Arbitrage: Efficient Reasoning via Advantage-Aware Speculation
TL;DR · AI 摘要
ARBITRAGE通过动态路由机制提升推理效率,在保持精度前提下减少推理延迟达2倍。
核心要点
- ARBITRAGE框架使推理延迟降低约2倍,精度保持不变
- 采用轻量级路由器预测模型优势,替代固定阈值机制
- 在数学推理基准测试中超越现有步级投机解码方法
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- ARBITRAGE框架
- 核心机制
- 动态路由生成
- 轻量级路由器
- 实验结果
- 延迟降低2倍
- 精度保持
- 相关工作
- 投机解码
- 步级验证
金句 / Highlights
值得收藏与分享的关键句。
ARBITRAGE通过动态路由减少推理延迟达2倍,保持精度不变
轻量级路由器预测模型优势,替代传统固定阈值机制
在数学推理基准测试中超越现有步级投机解码方法
Arbitrage: 通过优势感知推测实现高效推理 - Apple 机器学习研究
研究领域
语音与自然语言处理
内容类型
论文
发表时间
2026年8月
Arbitrage: 通过优势感知推测实现高效推理
作者 Monishwaran Maheswaranâ *, Rishabh Tiwariâ *, Yuezhou Huâ *, Kerem Dilmenâ , Coleman Hooperâ , Haocheng Xiâ , Nicholas Leeâ , Mehrdad Farajtabar, Michael W. Mahoneyâ â¡Â§, Kurt Keutzerâ , Amir Gholamiâ â¡
查看出版物
复制Bibtex
现代大型语言模型通过长链思维链实现了令人印象深刻的推理能力,但它们在推理过程中会产生巨大的计算成本,这促使人们寻找提高性能与成本比的技术。在这些技术中,推测解码通过使用快速但不准确的草稿模型自回归地提出标记,然后由更强大的目标模型并行验证,从而加速推理。然而,由于语义等价步骤中标记不匹配导致的不必要的拒绝,传统的标记级推测解码在推理任务中表现不佳。尽管近期工作已转向语义级验证,通过接受或拒绝整个推理步骤来提高效率,但现有步骤级方法仍会重新生成大量被拒绝的步骤,改进有限,浪费了宝贵的目标计算资源。为了解决这一挑战,我们提出了ARBITRAGE,一种新颖的步骤级推测生成框架,该框架根据草稿模型与目标模型之间的相对优势动态路由生成。ARBITRAGE不采用固定的接受阈值,而是使用经过训练的轻量级路由器预测目标模型可能生成更高质量步骤的时间。这种路由机制近似于理想化的ARBITRAGE ORACLE,始终选择更高质量的步骤,实现了接近最优的效率-准确性权衡。在多个数学推理基准测试中,ARBITRAGE始终超越先前的步骤级SD基线,匹配精度下推理延迟降低高达约2倍。
- â UC伯克利分校
- â¡ ICSI
- § LBNL
- * 贡献相同
相关阅读与更新
镜像推测解码:打破LLM推理中的串行障碍
2025年12月11日 研究领域 方法与算法 , 研究领域 语音与自然语言处理
推测解码通过使用草稿模型前瞻预测加速LLM推理,但收益受到自回归草稿生成成本的限制:增加草稿规模会提高接受率,但会引入额外的延迟开销,加剧速度-准确性权衡。先前方法(Medusa、Hydra、EAGLE)部分降低了草稿成本,但要么降低接受率,要么引入限制扩展的开销。我们提出Mirrorâ¦
阅读更多
推测流式处理:无需辅助模型的快速LLM推理
2024年11月19日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 EMNLP , NeurIPS研讨会
该论文被NeurIPS 2024的高效自然语言与语音处理(ENLSP)研讨会接受。
推测解码是一种基于辅助草稿模型预测结果来加速大型目标语言模型推理的显著技术。尽管效果显著,但在特定应用场景中,通常需要同时对草稿模型和目标模型进行微调,以实现较高的接受率。随着下游任务数量的增加……
在机器学习中发现机遇
我们的机器学习研究每天都在取得新突破。
Work with us