Holo4: powering generalist computer-use agents
Holo4模型在保持低成本的同时实现接近前沿模型的性能,支持多接口交互并开源轨迹数据。
入选理由:Holo4-27B在OSWorld 2.0基准得分61.7%,仅比Opus 5.5低19.1个百分点
论文
别名:AB
API使用能力评估基准
已跟踪 4 条高相关材料
最近变化
2026-09-28 · Holo4-27B在OSWorld 2.0基准得分61.7%,仅比Opus 5.5低19.1个百分点
为什么值得关注
AutomationBench 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Holo4: powering generalist computer-use agents
Hugging Face Blog · 8.5 分
Holo4模型在保持低成本的同时实现接近前沿模型的性能,支持多接口交互并开源轨迹数据。
Astra is our most aligned model, with substantial improvements in understanding user intent.
OpenAI(@OpenAI) · 8.5 分
OpenAI发布GPT-6 Astra模型,在多个专业领域基准测试中表现优异,显著提升用户意图理解能力。
Introducing Gemini 3.7 Flash
Google DeepMind Blog · 8.5 分
Google发布Gemini 3.7 Flash,性能提升显著且价格降低50%,适用于复杂编码和代理任务。
已收录 4 条与 AutomationBench 相关的内容,按评分排序。
Holo4模型在保持低成本的同时实现接近前沿模型的性能,支持多接口交互并开源轨迹数据。
入选理由:Holo4-27B在OSWorld 2.0基准得分61.7%,仅比Opus 5.5低19.1个百分点
OpenAI发布GPT-6 Astra模型,在多个专业领域基准测试中表现优异,显著提升用户意图理解能力。
入选理由:Astra在Agents’ Last Exam和AutomationBench等基准测试中达到SOTA。
Google发布Gemini 3.7 Flash,性能提升显著且价格降低50%,适用于复杂编码和代理任务。
入选理由:Gemini 3.7 Flash在FrontierCode 1.1 Main任务中准确率提升30.6%(43.6% vs 34.4%)
Google推出Gemini 3.7 Flash模型,性能较前代提升显著且价格降低50%,适用于编码、代理和复杂工作流程。
入选理由:7 Flash在FrontierCode 1.1 Main基准中准确率提升26.6%(43.6% vs 34.4%)