T
traeai
Sign in

论文

BFCL v4

别名:Berkeley Function Calling Leaderboard

多轮对话测试基准

已跟踪 2 条高相关材料

TraeAI 观察

最近变化

2026-08-26 · PROOF-Gen恢复93%失败场景,使Qwen3-4B-Instruct-2507性能从0.132提升至0.529

为什么值得关注

BFCL v4 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。

MLPerf代理推理基准测试工具调用机器学习

相关材料

已收录 2 条与 BFCL v4 相关的内容,按评分排序。

Apple Machine Learning Research 图标

PROOF-Gen: From Optimized Data to Better Distillation

Apple Machine Learning Research495 字 (约 2 分钟)
85

PROOF-Gen通过场景优化恢复93%失败轨迹,使模型蒸馏效果提升40%以上,苹果提出的新方法显著优化工具调用能力蒸馏。

入选理由:PROOF-Gen恢复93%失败场景,使Qwen3-4B-Instruct-2507性能从0.132提升至0.529

FeaturedArticle#机器学习#模型蒸馏#自然语言处理#工具调用英文
MLCommons 图标

MLCommons推出MLPerf Inference v6.1边缘代理推理基准,使用Qwen3.6-27B量化模型评估边缘设备多轮对话性能。

入选理由:Qwen3.6-27B模型采用Q4_K_M GGUF量化格式部署

FeaturedArticle#MLPerf#边缘计算#代理推理#基准测试英文

跨材料问答 · BFCL v4

回答基于:BFCL v4 相关 2 条材料
    0 / 500

    AI may generate inaccurate information. Please verify important content.