Apple Machine Learning Research

Scaling Categorical Flow Maps

8.5内容质量

TL;DR · AI 摘要

苹果研究团队成功训练1.7B参数的Categorical Flow Maps模型,在4步推理中生成高质量文本,且提出半离散设置下的似然界理论。

核心要点

  • 7B参数模型在4步推理中达到数据级token熵水平
  • 半离散似然界使CFM可参与标准LM基准测试
  • 大规模训练揭示了损失权重和时间调度的优化方向

结构提纲

按章节快速跳转。

  1. 指出CFM在语言建模中的潜力及现有研究的规模限制。

  2. 提出1.7B参数模型训练及半离散似然界理论。

  3. 展示4步推理生成高质量文本并达到数据级熵水平。

  4. 揭示大规模训练中的损失权重与时间调度优化需求。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Scaling Categorical Flow Maps
    • 方法论
      • 半离散似然界理论
      • 自蒸馏技术
    • 实验成果
      • 1.7B参数模型
      • 4步高质量生成
    • 挑战与优化
      • 损失权重调整
      • 时间调度策略

金句 / Highlights

值得收藏与分享的关键句。

#语言模型#流匹配#扩散模型#大规模训练
打开原文

扩展分类流映射 - Apple 机器学习研究

研究领域

语音与自然语言处理

内容类型

论文

发表时间

2026年8月

扩展分类流映射

作者 Oscar Davis†**, Anastasiia Filippova, Victor Turrisi, Amitis Shidani, Pierre Ablin, Marco Cuturi, Louis Béthune

查看出版物

复制Bibtex

连续扩散和流匹配模型可能成为语言建模(LM)中自回归方法的强大替代方案,因为它们解锁了一系列目前仅限于连续模态的优势,包括加速采样和倾斜。最近,几项工作展示了通过高斯分布和独热编码数据分布之间的简单流匹配过程生成离散数据的可能性。他们进一步展示了通过分类流映射(CFMs)实现加速采样的可行性,在少量步骤的设置中实现了具有竞争力的样本质量。然而,该方法仅在相对较小的规模(<1B)上进行了评估,其可扩展性问题仍未解决。在本文中,我们在2.1T个token上训练了一个1.7B参数的基础流模型,并通过自我蒸馏将其转化为CFM,该模型仅需4个推理步骤即可生成多样化、高质量的文本,同时保持接近数据级别的token熵。此外,我们引入了半离散设置下CFM的似然界,并展示了它们可用于在标准LM基准测试中对模型进行评分,结果与离散扩散方法相当。最后,我们揭示了在大规模训练这些模型时出现的一些挑战,并提供了关于损失权重和时间调度的指导性见解。

  • †牛津大学
  • ** 在苹果公司工作期间完成的研究

相关阅读与更新

流匹配模型的得分蒸馏

2025年12月16日 研究领域 计算机视觉 , 研究领域 方法与算法

扩散模型能够生成高质量图像,但受到缓慢迭代采样的限制。蒸馏方法通过实现一步或几步生成来缓解这一问题。流匹配最初作为独立框架引入,但随后在高斯假设下被证明在理论上等同于扩散,这引发了关于蒸馏技术(如得分蒸馏)是否能直接迁移的问题。我们提供了一个…

阅读更多

CAR-Flow:条件感知重参数化对齐源和目标以实现更好的流匹配

2025年11月12日 研究领域 计算机视觉 会议 NeurIPS

条件生成建模旨在从包含数据-条件对的样本中学习条件数据分布。为此,扩散和基于流的方法已取得令人信服的结果。这些方法使用学习到的(流)模型将初始标准高斯噪声(忽略条件)传输到条件数据分布。因此,模型需要学习质量和条件注入。为了简化…

发现机器学习领域的机遇

我们的机器学习研究每天都在取得新突破。

与我们合作 /think