Apple Machine Learning Research

Arbitrage: Efficient Reasoning via Advantage-Aware Speculation

8.5内容质量

TL;DR · AI 摘要

ARBITRAGE通过动态路由机制提升推理效率,在保持精度前提下减少推理延迟达2倍。

核心要点

  • ARBITRAGE框架使推理延迟降低约2倍,精度保持不变
  • 采用轻量级路由器预测模型优势,替代固定阈值机制
  • 在数学推理基准测试中超越现有步级投机解码方法

结构提纲

按章节快速跳转。

  1. 指出传统投机解码在推理任务中的效率瓶颈问题。

  2. 提出基于模型相对优势的动态路由生成框架ARBITRAGE

  3. 使用轻量级路由器替代固定阈值,实现更优效率-精度平衡。

  4. 在多个数学推理基准测试中减少延迟达2倍。

  5. 优于现有步级投机解码方法且无需辅助模型。

  6. ARBITRAGE为高效推理提供新范式,推动LLM部署优化。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • ARBITRAGE框架
    • 核心机制
      • 动态路由生成
      • 轻量级路由器
    • 实验结果
      • 延迟降低2倍
      • 精度保持
    • 相关工作
      • 投机解码
      • 步级验证

金句 / Highlights

值得收藏与分享的关键句。

#Large Language Models#Speculative Decoding#Efficient Reasoning#Machine Learning Research#Apple
打开原文

Arbitrage: 通过优势感知推测实现高效推理 - Apple 机器学习研究

研究领域

语音与自然语言处理

内容类型

论文

发表时间

2026年8月

Arbitrage: 通过优势感知推测实现高效推理

作者 Monishwaran Maheswaran†*, Rishabh Tiwari†*, Yuezhou Hu†*, Kerem Dilmen†, Coleman Hooper†, Haocheng Xi†, Nicholas Lee†, Mehrdad Farajtabar, Michael W. Mahoney†‡§, Kurt Keutzer†, Amir Gholami†‡

查看出版物

复制Bibtex

现代大型语言模型通过长链思维链实现了令人印象深刻的推理能力,但它们在推理过程中会产生巨大的计算成本,这促使人们寻找提高性能与成本比的技术。在这些技术中,推测解码通过使用快速但不准确的草稿模型自回归地提出标记,然后由更强大的目标模型并行验证,从而加速推理。然而,由于语义等价步骤中标记不匹配导致的不必要的拒绝,传统的标记级推测解码在推理任务中表现不佳。尽管近期工作已转向语义级验证,通过接受或拒绝整个推理步骤来提高效率,但现有步骤级方法仍会重新生成大量被拒绝的步骤,改进有限,浪费了宝贵的目标计算资源。为了解决这一挑战,我们提出了ARBITRAGE,一种新颖的步骤级推测生成框架,该框架根据草稿模型与目标模型之间的相对优势动态路由生成。ARBITRAGE不采用固定的接受阈值,而是使用经过训练的轻量级路由器预测目标模型可能生成更高质量步骤的时间。这种路由机制近似于理想化的ARBITRAGE ORACLE,始终选择更高质量的步骤,实现了接近最优的效率-准确性权衡。在多个数学推理基准测试中,ARBITRAGE始终超越先前的步骤级SD基线,匹配精度下推理延迟降低高达约2倍。

  • †UC伯克利分校
  • ‡ ICSI
  • § LBNL
  • * 贡献相同

相关阅读与更新

镜像推测解码:打破LLM推理中的串行障碍

2025年12月11日 研究领域 方法与算法 , 研究领域 语音与自然语言处理

推测解码通过使用草稿模型前瞻预测加速LLM推理,但收益受到自回归草稿生成成本的限制:增加草稿规模会提高接受率,但会引入额外的延迟开销,加剧速度-准确性权衡。先前方法(Medusa、Hydra、EAGLE)部分降低了草稿成本,但要么降低接受率,要么引入限制扩展的开销。我们提出Mirror…

阅读更多

推测流式处理:无需辅助模型的快速LLM推理

2024年11月19日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 EMNLP , NeurIPS研讨会

该论文被NeurIPS 2024的高效自然语言与语音处理(ENLSP)研讨会接受。

推测解码是一种基于辅助草稿模型预测结果来加速大型目标语言模型推理的显著技术。尽管效果显著,但在特定应用场景中,通常需要同时对草稿模型和目标模型进行微调,以实现较高的接受率。随着下游任务数量的增加……

在机器学习中发现机遇

我们的机器学习研究每天都在取得新突破。

Work with us