Apple Machine Learning Research

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

8.5内容质量

TL;DR · AI 摘要

LenVM通过token级价值建模实现生成长度控制,在LIFEBench任务中将长度得分提升至64.8,显著优于现有模型。

核心要点

  • LenVM在LIFEBench任务中使7B模型长度得分从30.9提升至64.8
  • 在200 token预算下GSM8K准确率63% vs 基线6%
  • 提供token级价值信号实现生成动态可解释性

结构提纲

按章节快速跳转。

  1. 生成长度影响推理成本与性能,现有方法缺乏细粒度建模

  2. ·LenVM框架

    将长度建模转化为价值估计问题,通过负奖励机制预测剩余长度

  3. 在LLMs/VLMs上验证有效性,LIFEBench得分提升108%

  4. 支持长度控制、预测及生成动态解释,提升效率与性能平衡

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • LenVM框架
    • 核心机制
      • 价值估计问题转化
      • 负奖励机制
    • 实验成果
      • LIFEBench 64.8得分
      • GSM8K 63%准确率
    • 应用价值
      • 长度控制
      • 动态解释

金句 / Highlights

值得收藏与分享的关键句。

#生成模型#长度建模#机器学习#Apple研究
打开原文

长度值模型:面向Token级长度建模的可扩展值预训练 - 苹果机器学习研究

研究领域

计算机视觉

,

语音与自然语言处理

内容类型

论文

发布日期

2026年7月

长度值模型:面向Token级长度建模的可扩展值预训练

作者 Zhen Zhang†, Changyi Yang‡§, Zijie Xia§, Zhen Yang, Chengzhi Liu†, Zhaotiao Weng†, Yepeng Liu†, Haobo Chen†, Jin Pan¶§, Chenyang Zhao§, Yuheng Bu†, Alkesh Patel, Zhe Gan, Xin Eric Wangâ€

查看出版物

复制Bibtex

Token是现代自回归模型中的基本计算单元,生成长度直接影响推理成本和推理性能。尽管其重要性,现有方法缺乏细粒度长度建模,主要在粗粒度序列级别进行操作。在本文中,我们引入了长度值模型(LenVM),这是一个基于Token的框架,可在每个解码步骤中对剩余生成长度进行建模。通过将长度建模表述为值估计问题,并为每个生成的Token分配一个恒定的负奖励,LenVM预测一个有界且折扣的回报,该回报作为剩余生成范围的单调代理。这种表述方式产生了无需标注、密集、无偏且可扩展的监督信号。在LLMs和VLMs上的实验表明,LenVM在推理时提供了高度有效的信号。在LIFEBench精确长度匹配任务中,将LenVM应用于7B模型,将长度得分从30.9提高到64.8,显著优于领先的闭源模型。此外,LenVM能够连续控制性能与效率之间的权衡。在预算为200个Token的GSM8K任务中,LenVM保持63%的准确率,而Token预算基线仅为6%。它还能从提示边界准确预测总生成长度。最后,LenVM的Token级值提供了对生成动态的可解释视图,揭示了特定Token如何将推理推向更短或更长的范围。结果表明,LenVM支持广泛的应用,包括长度控制、预测和生成动态的解释。这些结果表明,生成长度可以有效建模为Token级值信号,突显了LenVM作为长度建模通用框架的潜力,以及作为可能支持未来强化学习训练的特定长度值信号的潜力。

  • †加州大学圣芭芭拉分校
  • ‡ 卡内基梅隆大学
  • § LMSYS Org
  • ¶ 威斯康星大学麦迪逊分校

相关阅读与更新

理解Transformer中长度泛化的形式化框架

2025年4月10日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 ICLR

Transformer面临的一个主要挑战是泛化到训练期间未观察到的更长序列。尽管之前的工作已经实证表明,Transformer在长度泛化上可能成功或失败,具体取决于任务,但对该现象的理论理解仍然有限。在本工作中,我们引入了一个严格的理论框架来分析具有可学习绝对值的因果Transformer中的长度泛化...

阅读更多

数据集分解:通过可变序列长度课程加快LLM训练

/think

2024年11月19日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 NeurIPS

大型语言模型(LLMs)通常在由固定长度token序列组成的数据集上进行训练。这些数据集通过随机拼接不同长度的文档,然后将其分割成预设目标长度的序列(concat-and-chunk)来创建。最近的注意力实现通过屏蔽跨文档注意力,减少了token块的有效长度。此外,在长序列上进行训练变得……

发现机器学习领域的机遇

我们的机器学习研究每天都在取得突破性进展

与我们合作