PROOF-Gen: From Optimized Data to Better Distillation
PROOF-Gen通过场景优化恢复93%失败轨迹,使模型蒸馏效果提升40%以上,苹果提出的新方法显著优化工具调用能力蒸馏。
入选理由:PROOF-Gen恢复93%失败场景,使Qwen3-4B-Instruct-2507性能从0.132提升至0.529
论文
别名:Berkeley Function Calling Leaderboard
多轮对话测试基准
已跟踪 2 条高相关材料
最近变化
2026-08-26 · PROOF-Gen恢复93%失败场景,使Qwen3-4B-Instruct-2507性能从0.132提升至0.529
为什么值得关注
BFCL v4 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
PROOF-Gen: From Optimized Data to Better Distillation
Apple Machine Learning Research · 8.5 分
PROOF-Gen通过场景优化恢复93%失败轨迹,使模型蒸馏效果提升40%以上,苹果提出的新方法显著优化工具调用能力蒸馏。
Call for Submission: Edge Agentic Inference Benchmark for MLPerf Inference v6.1
MLCommons · 8.5 分
MLCommons推出MLPerf Inference v6.1边缘代理推理基准,使用Qwen3.6-27B量化模型评估边缘设备多轮对话性能。
已收录 2 条与 BFCL v4 相关的内容,按评分排序。
PROOF-Gen通过场景优化恢复93%失败轨迹,使模型蒸馏效果提升40%以上,苹果提出的新方法显著优化工具调用能力蒸馏。
入选理由:PROOF-Gen恢复93%失败场景,使Qwen3-4B-Instruct-2507性能从0.132提升至0.529
MLCommons推出MLPerf Inference v6.1边缘代理推理基准,使用Qwen3.6-27B量化模型评估边缘设备多轮对话性能。
入选理由:Qwen3.6-27B模型采用Q4_K_M GGUF量化格式部署