PROOF-Gen: From Optimized Data to Better Distillation
TL;DR · AI 摘要
PROOF-Gen通过场景优化恢复93%失败轨迹,使模型蒸馏效果提升40%以上,苹果提出的新方法显著优化工具调用能力蒸馏。
核心要点
- PROOF-Gen恢复93%失败场景,使Qwen3-4B-Instruct-2507性能从0.132提升至0.529
- 部署后提升轨迹质量+6.3pp,非英语地区平均提升+1.48pp
- 方法通过反射器生成纠正指导,学生模型无需任务特定支架
结构提纲
按章节快速跳转。
- §引言
当前蒸馏方法因失败场景无信号导致性能瓶颈
通过场景特定提示优化恢复失败轨迹
- ›实验结果
在Ï 2-bench恢复93%失败场景,多模型性能显著提升
- ·部署效果
提升轨迹质量+6.3pp并实现跨语言正迁移
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- PROOF-Gen方法
- 核心机制
- 场景特定提示优化
- 反射器生成纠正指导
- 实验结果
- 恢复93%失败场景
- 多模型性能提升
- 部署效果
- +6.3pp轨迹质量提升
- 跨语言正迁移
金句 / Highlights
值得收藏与分享的关键句。
PROOF-Gen恢复93%失败场景,使Qwen3-4B-Instruct-2507 PassË1从0.132提升至0.529
部署后轨迹质量提升+6.3pp,非英语地区平均+1.48pp
反射器生成纠正指导,学生模型无需任务特定支架
PROOF-Gen:从优化数据到更优蒸馏 - Apple 机器学习研究
研究领域
语音与自然语言处理
,
工具、平台、框架
会议
EMNLP
内容类型
论文
发布日期
2026年8月
PROOF-Gen:从优化数据到更优蒸馏
作者 Anh Ta, Junjie Zhu, Shahin Shayandeh
查看出版物
复制Bibtex
对教师生成的轨迹进行监督微调是将工具调用能力蒸馏到可部署模型的标准第一阶段。已部署工具调用代理的后训练流水线每天或每周重复执行此阶段,每次循环都要支付前沿教师成本,但该机制采用生成并过滤(保留教师通过的轨迹,丢弃其余部分)的方式,每次循环都会留下相同的困难场景,因为失败无法提供信号。在Ï 2-bench基准测试中,57%的教师尝试失败,其中三分之二为接近失败(大多数工具调用正确,但被一个决定性错误破坏)。
我们引入PROOF-Gen(基于场景的反思优化以克服生成失败),通过基于场景的提示优化从这些失败中恢复黄金轨迹。对于每个失败任务,反射器分析执行轨迹和评估反馈,然后编写纠正指导以引导教师走向通过轨迹。指导内容在训练前被剥离,因此学生从没有任务特定支架的干净演示中学习。
在Ï 2-bench基准测试中,基于场景的优化恢复了93%的失败场景。在合并数据上微调后,Qwen3-4B-Instruct-2507从PassË1=0.132提升至0.529,Gemma 4 E4B-it在BFCL v4多轮测试中提升7.2个百分点。在部署流水线中,该方法使轨迹质量提升6.3个百分点的目标完成度,并转移到部署的设备模型(目标完成度提升1.5个百分点;响应质量指标提升1.7至5.0个百分点),所有地区均实现正向迁移(非英语平均提升1.48个百分点)。
相关阅读与更新
Agent Seer:从规范理解合成场景
2026年8月28日 研究领域 数据科学与标注 , 研究领域 工具、平台、框架
评估使用外部工具的AI代理需要真实测试场景,以捕捉从业者如何组合工具并在对话轮次间迭代。手动构建此类场景需要深厚领域专业知识,无法跨工具生态系统扩展,且生成的静态基准无法跟踪不断演进的API。我们观察到工具规范(函数名称、自然语言描述、类型化参数等)可以...
阅读更多
蒸馏扩展定律
2025年7月1日 研究领域 方法与算法 , 研究领域 语音与自然语言处理 会议 ICML
我们提出一种蒸馏扩展定律,根据计算预算及其在学生和教师之间的分配来估计蒸馏模型性能。我们的研究通过使教师和学生都能实现计算最优分配来降低大规模蒸馏的风险,从而最大化学生性能。我们为两种关键场景提供计算最优蒸馏方案:当教师已存在时,以及当...
发现机器学习领域的机遇
我们的机器学习研究每天都在取得新突破。
与我们合作 /think