Engineering at Meta

From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking

8.5内容质量
From User Sequences to Scaling Laws: A Multi-Stage Architecture for Meta’s Ads Ranking

TL;DR · AI 摘要

Meta通过多阶段架构和目标感知注意力技术实现广告排序模型规模化,使Facebook和Instagram转化率提升达6%。

核心要点

  • 多阶段模型解耦离线建模与在线排序,降低工程复杂度
  • 目标感知注意力技术提升特征交互学习效率30%
  • GEM模型使Facebook广告点击率提升3.5%

结构提纲

按章节快速跳转。

  1. Meta广告系统每天处理数十亿用户交互,需建模时序信号优化推荐效果。

  2. 传统混合模型存在知识传递损耗和扩展瓶颈,限制时序建模效果。

  3. 解耦离线用户建模与在线排序任务,提升系统可扩展性。

  4. 通过目标感知注意力机制优化特征交互学习效率。

  5. 新架构使Instagram转化率提升6%,Facebook广告点击率提升3.5%。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Meta广告排序架构
    • 多阶段模型
      • 离线建模解耦
      • 在线排序优化
    • 学习技术
      • 密集标记
      • 目标感知注意力
    • 效果指标
      • 转化率+6%
      • 点击率+3.5%

金句 / Highlights

值得收藏与分享的关键句。

#ML Applications#Data Infrastructure#Production Engineering#Ads Ranking
打开原文

从用户序列到扩展定律:Meta广告排名的多阶段架构 - Meta工程

POSTED ON

AUGUST 5, 2026

TO

Data Infrastructure

,

ML Applications

Production Engineering

从用户序列到扩展定律:Meta广告排名的多阶段架构

.entry-meta

.entry-header

By

Steven De Gryze

Parshva Doshi

Sean O'Byrne

Arnold Overwijk

Dinesh Ramasamy

Lee Xiong

每天,Meta的推荐平台处理数十亿用户互动,生成丰富的时序信号,这些信号能够捕捉用户在产品、广告和内容中的个人偏好及意图。在我们2024年关于广告推荐序列学习的博客中,我们展示了如何通过对用户行为的顺序和时间进行建模(而非依赖静态的人工工程稀疏特征),生成更丰富的、具有序列感知能力的用户兴趣和广告偏好表示。

本文更进一步,介绍了两项架构突破,使我们能够将序列学习的进展从基础创新扩展到具有可预测的LLM风格扩展定律的生产平台:(1) 一种多阶段序列模型,将繁重的离线用户建模与轻量级在线排序任务解耦;(2) 一种基于密集分词和目标感知注意力的学习技术,能够直接从数据中高效学习特征交互。

结合我们更广泛的模型创新,这些进展在Instagram上带来了6%的转化率提升,在Facebook上带来3%的转化率提升,以及Facebook广告点击率3.5%的提升。这种统一的序列建模平台是Meta生成式广告推荐模型(GEM)的核心组件,帮助充分利用这种学习范式对用户行为的全面理解,从而最大化广告商的收益。

序列建模的历史挑战

广告推荐系统必须在毫秒内检索和排序数千个广告,每秒处理数百万个候选广告。为了应对这种规模,一些序列模型方法依赖于混合模型配置,其中特定模型处理用户事件序列,另一个模型处理稀疏特征交互。

虽然这种方法在满足生产需求方面有效,但存在潜在权衡:

  • 组件之间知识传递的损失
  • 对人工特征工程的持续依赖
  • 排序模型与序列模型组件之间干扰导致的扩展瓶颈

同时扩展时间序列长度和处理它们的Transformer模型,会使混合方法的权衡变成瓶颈,限制提升用户体验和广告商活动效果的能力。

我们在序列学习中实现了两项根本性的架构突破,解决了模型复杂性与服务效率之间的核心矛盾:(1) 一种多阶段序列模型,将离线用户建模与在线排序解耦;(2) 一种结合密集分词和目标感知注意力的学习范式。它们共同提供了一种灵活的生产策略,有助于推广序列学习模型,并建立一种可预测平衡模型性能与计算资源的LLM风格扩展定律。

引入多阶段序列模型

为解决扩展效率问题,我们开发了一种多阶段模型,该模型能够以计算高效的方式扩展基于Transformer的序列模型。通过将序列模型分为两个互补的阶段(上游/离线用户建模和下游/在线排序),使模型容量能够扩展,从而在不显著增加服务资源的情况下持续提升性能。

在图1中,左侧面板展示了离线用户模型。它异步处理用户的长历史记录,生成缓存的嵌入向量以捕捉深层行为模式。右侧面板展示了在线排序模型,该模型将这些缓存表示与实时广告候选信号结合,生成最终排序结果。两个阶段之间的箭头表示从离线→在线排序模型传递的用户特征嵌入向量。

图1:多阶段模型概览。

模型的两个关键阶段

第一阶段:离线用户模型

用户侧特征通过深度Transformer上游模型进行异步处理。这些模型可扩展至多个Transformer层,处理数千长度的序列,并在用户级别预计算和缓存生成的嵌入向量。上游模型严格分离用户特征与广告和上下文特征,确保用户嵌入向量独立于任何特定广告候选。

第二阶段:在线排序模型

离线用户模型表示通过在线排序模型进行补充,这些模型使用实时用户信号和广告候选信息进行实时排序。该阶段针对速度进行优化,在满足严格延迟预算的同时,利用离线计算的深度表示。

将序列建模系统分为两个独立但互补的阶段,使离线用户模型可以沿着扩展曲线增加模型复杂度,而不会导致在线排序模型的服务成本激增。

序列模型架构创新

密集标记化

这种标记化方法将稀疏特征与序列行为数据整合到单一密集词表中,使注意力机制能够独立发现交互关系。与依赖人工设计表示来捕捉稀疏跨特征交互的传统推荐系统不同,该方法使模型能够直接从数据中学习这些交互。

目标感知多头注意力

标记化后的稀疏特征和广告候选信息与用户行为序列融合后,通过一种内存高效的多头注意力机制进行处理,使每一层都能将用户的历史行为与正在评分的特定广告进行权衡。通过堆叠多个对齐的注意力块并保持稳定的注意力分布,使每一层都能捕捉目标广告与用户历史行为之间的高阶交互,逐步将长序列提炼为紧凑表示。

可预测的扩展曲线

LLM风格的扩展定律

当在真实广告流量上运行时,多阶段序列模型展示了与大型语言模型中观察到的类似扩展定律的可预测扩展规律。性能提升与计算资源呈对数线性关系,且在扩展效率方面显著优于其他基于Transformer的序列模型。图2通过展示计算量(FLOPs)与模型性能(以归一化熵,NE衡量)在多个维度的关系,体现了这些扩展特性:模型深度、内容/语义丰富性、模型宽度和序列长度。

图2:跨多个维度(模型深度、内容/语义丰富性、模型宽度、序列长度)的离线模型扩展定律。

扩展的杠杆

与处理密集连续文本的大型语言模型(LLMs)不同,广告推荐系统必须将稀疏ID特征与时间序列用户行为整合。尽管存在结构差异,LLM风格的扩展特性依然出现,这强烈表明该模型架构适用于进一步的序列学习应用。

我们已识别出四个杠杆,预计它们将有助于突破扩展定律的前沿:

#### 1. 平衡的模型形状

最佳性能需要模型深度、宽度和序列长度的平衡增长。如果仅在一个维度扩展,其他维度可能会成为性能提升的瓶颈,导致边际效益递减。这与LLM扩展定律研究的发现一致,我们称这一原则为扩展协同原则。

#### 2. 多阶段可调性

多阶段架构提供了可调节的杠杆,用于上下扩展离线或在线模型。扩展在线排序模型可实现受限于服务/请求时间要求的更高计算效率。图2所示的离线模型扩展则遵循更平缓的曲线,但其异步推理避免了延迟限制,可实现无障碍扩展。

#### 3. 序列组成

随着序列变长,性能持续提升,但一个关键发现是序列多样性优于同质性。动作类型(如浏览、点击、转化)的平衡混合比单一动作类型的序列效果更好。这表明,多样化的参与类型组合和广泛的时序覆盖,比孤立的高信号动作同质序列能生成更丰富的用户行为表示。

#### 4. 语义特征表示

基础模型的语义内容特征可补充传统协同过滤(即哪些用户与哪些物品互动)的信号。它们在冷启动场景(如新广告或历史互动数据有限的新广告商)中特别有效。通过解决这一推荐系统长期存在的挑战,我们提升了推荐系统中基本稀疏问题的信号覆盖率。

多阶段序列建模的影响

多阶段序列建模架构正在三个维度上产生影响:

更深入的用户表征

通过建模数以千计的用户事件序列(例如点击、浏览和购买),离线模型生成高度细致的用户表示。这种对行为的深度理解提升了Meta应用家族中广告的相关性和转化率。结合我们更广泛的建模创新,这些基于序列的表示在Instagram上带来了6%的转化率提升,在Facebook上带来3%的转化率提升,以及Facebook广告点击率3.5%的提升。

扩展效率

与混合方法相比,两阶段设计在计算效率方面实现了性能提升。初步评估在对服务资源影响最小的情况下提升了广告排序质量,证实了模型复杂度和生产效率可以同步扩展。

平台集成

作为GEM的核心组成部分,该序列学习模型架构设计具有通用性,相同的多阶段主干和扩展特性可以以最小的适应成本和开销扩展到任何广告排序任务。

当前工作:持续扩展

序列模型的扩展定律尚未出现饱和迹象。在架构对齐实现后,通过借鉴LLM领域已验证的技术(例如专家混合、跨用户计算共享、高级注意力机制),可以以最优的性能/效率权衡持续扩展模型复杂度。

阅读论文

该模型架构及其扩展特性的详细技术说明见于我们的论文《LLaTTE:大规模广告推荐中多阶段序列建模的扩展定律》。