Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling
TL;DR · AI 摘要
LenVM通过token级价值建模实现生成长度控制,在LIFEBench任务中将长度得分提升至64.8,显著优于现有模型。
核心要点
- LenVM在LIFEBench任务中使7B模型长度得分从30.9提升至64.8
- 在200 token预算下GSM8K准确率63% vs 基线6%
- 提供token级价值信号实现生成动态可解释性
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- LenVM框架
- 核心机制
- 价值估计问题转化
- 负奖励机制
- 实验成果
- LIFEBench 64.8得分
- GSM8K 63%准确率
- 应用价值
- 长度控制
- 动态解释
金句 / Highlights
值得收藏与分享的关键句。
LenVM在200 token预算下保持63%准确率,基线仅6%
长度得分从30.9提升至64.8,超越前沿闭源模型
token级价值信号揭示特定token对生成长度的影响机制
长度值模型:面向Token级长度建模的可扩展值预训练 - 苹果机器学习研究
研究领域
计算机视觉
,
语音与自然语言处理
内容类型
论文
发布日期
2026年7月
长度值模型:面向Token级长度建模的可扩展值预训练
作者 Zhen Zhangâ , Changyi Yangâ¡Â§, Zijie Xia§, Zhen Yang, Chengzhi Liuâ , Zhaotiao Wengâ , Yepeng Liuâ , Haobo Chenâ , Jin Pan¶§, Chenyang Zhao§, Yuheng Buâ , Alkesh Patel, Zhe Gan, Xin Eric Wangâ
查看出版物
复制Bibtex
Token是现代自回归模型中的基本计算单元,生成长度直接影响推理成本和推理性能。尽管其重要性,现有方法缺乏细粒度长度建模,主要在粗粒度序列级别进行操作。在本文中,我们引入了长度值模型(LenVM),这是一个基于Token的框架,可在每个解码步骤中对剩余生成长度进行建模。通过将长度建模表述为值估计问题,并为每个生成的Token分配一个恒定的负奖励,LenVM预测一个有界且折扣的回报,该回报作为剩余生成范围的单调代理。这种表述方式产生了无需标注、密集、无偏且可扩展的监督信号。在LLMs和VLMs上的实验表明,LenVM在推理时提供了高度有效的信号。在LIFEBench精确长度匹配任务中,将LenVM应用于7B模型,将长度得分从30.9提高到64.8,显著优于领先的闭源模型。此外,LenVM能够连续控制性能与效率之间的权衡。在预算为200个Token的GSM8K任务中,LenVM保持63%的准确率,而Token预算基线仅为6%。它还能从提示边界准确预测总生成长度。最后,LenVM的Token级值提供了对生成动态的可解释视图,揭示了特定Token如何将推理推向更短或更长的范围。结果表明,LenVM支持广泛的应用,包括长度控制、预测和生成动态的解释。这些结果表明,生成长度可以有效建模为Token级值信号,突显了LenVM作为长度建模通用框架的潜力,以及作为可能支持未来强化学习训练的特定长度值信号的潜力。
- â 加州大学圣芭芭拉分校
- â¡ 卡内基梅隆大学
- § LMSYS Org
- ¶ 威斯康星大学麦迪逊分校
相关阅读与更新
理解Transformer中长度泛化的形式化框架
2025年4月10日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 ICLR
Transformer面临的一个主要挑战是泛化到训练期间未观察到的更长序列。尽管之前的工作已经实证表明,Transformer在长度泛化上可能成功或失败,具体取决于任务,但对该现象的理论理解仍然有限。在本工作中,我们引入了一个严格的理论框架来分析具有可学习绝对值的因果Transformer中的长度泛化...
阅读更多
数据集分解:通过可变序列长度课程加快LLM训练
/think
2024年11月19日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 NeurIPS
大型语言模型(LLMs)通常在由固定长度token序列组成的数据集上进行训练。这些数据集通过随机拼接不同长度的文档,然后将其分割成预设目标长度的序列(concat-and-chunk)来创建。最近的注意力实现通过屏蔽跨文档注意力,减少了token块的有效长度。此外,在长序列上进行训练变得……
发现机器学习领域的机遇
我们的机器学习研究每天都在取得突破性进展
与我们合作