T
traeai
登录

论文

AutomationBench

别名:AB

API使用能力评估基准

已跟踪 4 条高相关材料

TraeAI 观察

相关材料

已收录 4 条与 AutomationBench 相关的内容,按评分排序。

Hugging Face Blog 图标

Holo4: powering generalist computer-use agents

Hugging Face Blog1629 字 (约 7 分钟)
85

Holo4模型在保持低成本的同时实现接近前沿模型的性能,支持多接口交互并开源轨迹数据。

入选理由:Holo4-27B在OSWorld 2.0基准得分61.7%,仅比Opus 5.5低19.1个百分点

精选文章#Holo4#模型#Hugging Face#计算机使用代理英文
Google DeepMind Blog 图标

Introducing Gemini 3.7 Flash

Google DeepMind Blog954 字 (约 4 分钟)
85

Google发布Gemini 3.7 Flash,性能提升显著且价格降低50%,适用于复杂编码和代理任务。

入选理由:Gemini 3.7 Flash在FrontierCode 1.1 Main任务中准确率提升30.6%(43.6% vs 34.4%)

精选文章#Gemini#AI模型#Google#DeepMind#编码工具英文
Introducing Gemini 3.7 Flash

Introducing Gemini 3.7 Flash

The Keyword (blog.google)954 字 (约 4 分钟)
85

Google推出Gemini 3.7 Flash模型,性能较前代提升显著且价格降低50%,适用于编码、代理和复杂工作流程。

入选理由:7 Flash在FrontierCode 1.1 Main基准中准确率提升26.6%(43.6% vs 34.4%)

精选文章#Gemini#AI模型#Google#机器学习#编码工具英文

跨材料问答 · AutomationBench

回答基于:AutomationBench 相关 4 条材料
    0 / 500

    AI 可能会生成不准确的信息,请核实重要内容