Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization

TL;DR · AI 摘要
Exploring Hierarchical Interest Representation For Meta Ads Deep Funnel Optimization - Engineering at Meta POSTED ON JUL...
核心要点
- 主题聚焦:Exploring Hierarchical Interest Representation F
- 来源:Engineering at Meta,建议结合原文判断细节。
- AI 分析暂不可用,本条为保底评分与摘要。
探索分层兴趣表示在Meta广告深度漏斗优化中的应用 - Meta工程实践
POSTED ON
JULY 15, 2026
TO
AI Research
探索分层兴趣表示在Meta广告深度漏斗优化中的应用
.entry-meta
.entry-header
By
欧阳宇辉
,
王迪
Sreedal Menon
田杰
- 分层兴趣表示是Meta广告领域的研究方向。我们正在探索一个覆盖广告实体宇宙的上游表示层——用户、广告主、产品、服务——学习统一的嵌入表示,将用户推断的兴趣与广告主在深度漏斗广告中提供的广泛内容相连接。
- 分层兴趣表示的创新点在于基于内部变压器的图学习,包含有偏见感知的注意力机制和自监督跨视图蒸馏技术,能够在大规模图中学习多层级的兴趣表示。
- 分层兴趣表示融合现实世界知识与互动信号——通过LLM处理的多模态广告商和产品内容,丰富稀疏互动,实现对罕见和未见实体的泛化能力。
- 分层兴趣表示输出广告实体的通用嵌入表示和Bag-of-Meaning兴趣标记,这些表示有望在广告系统栈中推动新的个性化、检索、监督和专用排序架构。
- 在数十亿次互动规模的真实Meta广告数据上端到端训练。
分层兴趣表示是一个旨在改进Meta深度漏斗排序优化的上游表示层。它旨在将企业与平台上对其产品和服务具有最真实、潜在兴趣的人群连接起来。该系统设计用于跨Meta更广泛的推荐生态系统,如Meta的生成式广告模型(GEM)、Andromeda和自适应排序模型,以推进深度漏斗优化。
人们使用Meta的应用和平台来连接他人和内容,通过每一次滚动表达偏好。互动信号被用来理解推断兴趣和显式兴趣,提升平台内容的相关性。利用前沿AI技术从稀疏互动信号中映射潜在兴趣,并将其与广告商提供的广阔景观对齐,是解决信号稀缺挑战并提升深度漏斗广告效果的变革性方法。
该系统的使命是加强广告实体景观中的推理关系——涵盖用户、企业和产品——利用多层级粒度,使我们的模型能够在稳定的高层兴趣锚点和深度漏斗意图的专用稀疏信号之间进行导航。
分层兴趣表示如何增强深度漏斗优化
分层兴趣表示通过导航长距离图拓扑结构,将稀疏互动信号提炼为不同粒度的统一兴趣集群,开创了表示建模的结构性转变。通过融合现实世界知识与对广告产品的语义理解,它有效加强了广告与用户意图之间的联系。
分层兴趣表示通过从海量互动数据集中提取稳定的兴趣锚点,并基于多模态世界知识的丰富内容进行锚定,鼓励以发现为导向的广告体验。其目标是实现更相关广告内容的投放,从而优化深度漏斗广告效果。
技术挑战
用户与广告实体的互动本质上是图结构的:用户和广告实体(广告主、产品、服务、广告活动等)是节点,连接它们的活动和事件是边。在Meta的规模下,这是业界最大的图网络之一。学习兴趣表示面临以下挑战:
用户推断信号动态性
Meta为用户提供工具帮助定制体验,例如对看到的帖子提供“感兴趣/不感兴趣”的反馈。此外,基于互动信号推断的兴趣在提升深度漏斗广告效果中仍发挥着重要作用。
大规模稀疏连接网络
每月,Meta的广告网络为数百万广告主的数百万广告提供服务,触达平台上的数十亿用户。尽管这个“词汇库”规模庞大,但广告展示机会有限,深度漏斗用户反馈也十分稀缺。
长距离全局关系
鉴于深度漏斗中单个连接的稀疏性,观察长距离图连接实体和用户之间的共性模式并将其编码到表示中具有实际价值。在大规模图网络中捕捉长距离关系计算成本高昂。即使硬件能力持续提升,对建模精度的追求仍需要设计内存高效的注意力内核和高性能学习算法。
分层兴趣表示介绍
我们最新的研究领域是学习用户和广告实体通用关系知识表示的上游表示层。这些表示捕捉用户的广告互动模式,吸收现实世界语义,并通过多级分层粒度级联,最终在每一层级生成潜在空间投影。基于图数据结构,四个设计特性驱动系统端到端运行:
维度缩减
分层兴趣表示将原始图投影到可配置的超图中,每个超节点是一个学习到的潜在兴趣原语。在原始图中稀疏的用户-广告边在原语兴趣图中变得更有意义且更密集。本质上,原语兴趣图在词汇层面更加稳定,即使广告业务本身更具动态性。
知识丰富
分层兴趣表示通过文本、图像和视频等多模态内容特征,丰富异构实体(特别是广告主和产品类型)。这些特征从结构化页面元数据和广告主目录属性中提取,并通过视觉或语言模型进行处理。这些额外信息补充了现有互动数据。与其仅仅知道用户如何与某物互动,它更能捕捉该事物的本质。即使遇到前所未见的实体,也能理解其背后的业务和产品。
层次化兴趣表示在单一度量空间中同时学习用户和实体的全面知识表示及其潜在兴趣原语表示。它可以推断实体在类型内部或跨类型之间的相互关系和亲和力。通过嵌入操作,层次化兴趣表示能够确定原语间的关联以及聚类间的关联。它还可以估算用户与兴趣原语的接近程度;广告/广告商服务于特定兴趣原语的程度;以及哪些用户、广告和产品是最近邻的相似项。
多层次粒度
鉴于深度漏斗信息的整体稀疏性,在映射到原始兴趣时存在权衡。密集且稳定的关联通常意味着更粗粒度和更高层次的抽象,而稀疏且具体的连接则关注更细粒度的抽象。层次化兴趣表示学习超级图,通过多层级的层次结构进行级联,以实现灵活性,适配排序建模架构、个性化或检索应用。
层次化兴趣表示架构
层次化兴趣表示通过结合广告商和产品的世界知识与用户的直接时间参与数据构建表示。其受LLM启发的Transformer架构应用于大规模图结构,利用稀疏注意力机制捕捉长距离关系。该系统旨在为广告平台上的各种应用(从检索到最终阶段排序)提供支持。
以下部分将详细说明层次化兴趣表示系统中每个组件的架构设计。
丰富参与图
#### 异构图结构
层次化兴趣表示基于一种类型化、加权、时间衰减的图结构,统一了多种实体类型——用户、广告、广告商、广告活动、产品和像素。这些实体通过类型化的参与边连接,包括企业创建广告素材以及用户与广告的互动旅程。每条边都携带其动作类型和时间戳,平衡近期意图与长期兴趣。这种类型化、异构的结构使得单一下游表示能够推理某人的生活方式、广告商的目录覆盖范围以及连接它们的产品——所有内容都在统一空间中。
#### 扩展至Meta生产数据
该图每月覆盖数十亿用户、实体及其互动,既在线提供生产新鲜度,也离线用于评估和快速迭代。每个节点携带丰富的初始嵌入,融合预训练语义特征与行为统计信息。高频节点通过深度哈希嵌入添加可学习的ID嵌入,即对节点ID哈希向量应用一个小的共享神经网络,随着词汇量扩展到十亿级别时保持ID内存的有限性。
世界知识作为连接给定点的手段,在相对静态实体(如广告商、产品等)中具有丰富的信息。我们从摘要文本、图像和视频中检索多模态信息,并通过定制的LLM推理引擎进行处理,生成用于表示学习的编码特征输入。
#### 结构编码器
分层编码器的输入层结合了丰富的互补编码器。节点编码器融合节点类型、深度哈希控制的节点ID、世界知识特征和每种类型的元数据/特征,使每个节点在进入学习模型时同时具备语义身份和现实世界内容。位置编码器通过对图的采样视图应用位置编码,注入局部拓扑结构,采用随机游走和重要性优先策略。边编码器准备边类型、边权重和时间信号,以流入注意力学习机制。
#### 偏差组成
Transformer通过注意力机制衡量标记之间的成对关系。图结构本身通过构建方式编码节点之间的成对关系。这两个概念自然互补。图结构信号(如事件边上的节点类型转换和局部连通性的最短路径距离)作为注意力偏差进入模型,增强每一层查询-键点积。
这使模型具备拓扑感知能力。与将子图视为节点集合不同,分层编码器通过明确的结构关系知识进行注意力计算,捕捉标准消息传递机制容易过度平滑的长距离关系。
#### 注意力核
向注意力机制添加图结构偏差通常成本较高:标准实现会生成完整的成对偏差矩阵,导致从内存高效的注意力机制回退。我们采用FlexAttention,该方法实时计算每个偏差项,使成对矩阵从未被显式生成。可变长度子图被封装为单个块掩码序列,避免填充浪费和跨图泄露。新的偏差项作为小型评分规则插入,无需底层内核操作。结果实现了内存高效的注意力机制,并具备完整的图结构感知能力。
训练分层编码器
#### 跨视图蒸馏
分层编码器通过配对教师-学生方案进行自监督训练。对于每个锚点节点,我们采样一个宽泛的教师视图和一个狭窄的学生视图,两者都经过分层编码器处理。学生被训练以预测与教师相同的兴趣聚类。由于教师能看到更宽泛的图视图,其预测更具信心,为学生提供明确的匹配目标。这将监督范围扩展到远超产生深度漏斗转化的少数用户,解决了推动分层兴趣表示的参与稀疏性问题。Sinkhorn-Knopp平衡分配防止单聚类崩溃,这是自监督方法已知的失效模式。
#### 参与预测
自蒸馏通过教导模型相同节点的不同视图应聚类在一起,从而发现图中潜在的兴趣原始特征。参与预测增加了互补的监督目标——给定两个节点表示、参与类型和时间,预测该时间点是否存在真实的参与边。两者结合,使分层兴趣表示既具备视图不变的结构先验,又直接基于观察到的用户行为进行锚定,从而成为贯穿投放系统各环节的通用评分函数。
#### 在线图基础设施
原始异构图存储在Meta的在线图引擎中。相同的数据源同时支持训练和在线服务,确保两者分布一致。训练时,子图获取和节点特征读取与GPU计算流水线并行执行。多个工作节点并行准备后续批次,而模型在当前批次上训练,将数据加载延迟隐藏在前向和反向传播过程中。测试阶段相比同步基线实现了30倍的时钟速度提升,同时保持GPU模型FLOPs利用率较高。端到端保留了比特精确的可复现性,因此基础设施迁移和检查点恢复不会静默改变模型行为。
#### 因果性
为防止信息泄露,训练和评估严格遵循事件的时间顺序。图引擎对每次调用应用时间戳截断,并屏蔽该时间点之后的节点或边。
边按时间顺序划分为训练、验证和测试窗口。批次仅在固定时间块内打乱,为优化器提供梯度多样性而不跨越时间边界。模型仅从当时可获得的信息中学习,因此准确率提升反映真实学习效果而非未来信息泄露。
词元化
#### 意义词袋词元
连续的通用嵌入在排序任务中表现强大,但并不天然适合倒排索引检索、集合聚合或人工解释。我们通过复合量化将其离散化为意义词袋(BoM)词元——一种由兴趣概念组成的紧凑无序词汇表。用户通过描述其兴趣的BoM词元表示,广告或广告商则通过其服务兴趣的BoM词元表示。
在投放系统各环节激活分层兴趣表示
分层兴趣表示的设计目标是将学习到的兴趣表示嵌入广告投放系统,最终通过GEM、Andromeda和自适应排序模型等现有组件提升深度漏斗排序效果。例如,BoM词元通过引入用户潜在兴趣增强基于参与度的个性化和监督,同时实现快速紧凑的倒排索引召回。分层兴趣表示的多层级结构支持专用架构,如由超级兴趣类别路由的专家混合生成分布学习,以及基于稳定兴趣锚点的用户-广告亲和力分层推理。
分层兴趣表示的未来
我们将继续提升训练扩展效率、嵌入新鲜度、知识压缩能力以及内存高效的注意力内核,以增强模型的表达能力。我们还在研究参数高效的上游分层兴趣表示的条件微调方法,通过共享编码器实现对异构深度漏斗优化目标的片段级专业化适配。
致谢
我们感谢 Sammy Bald、Shaoqing Yuan、Chuan Hu、Chris Hayduk、Wenfan Xu、Liang Xu、Piyush Dak、Ikuhiro Ihara、Ashish Kalbhor、Manjari Jha、Priya Krishnamurthy、Xulei Liu、JC Lyu、Yuqi Bi、Vivek Bitla、Krishna Poola、Jiayin Ge、Santanu Kolay、Matt Steiner、Sandeep Pandey、Gunjit Singh、Marvin Kim、Karan Jindal、Krishi Suresh Kumar、Mehul Parsana、Manveer Kaur、Hua Liu 以及分层兴趣表示项目开发和生产团队的所有成员。