ITBench-AA: 前沿模型在第一个企业级自动化 IT 任务基准测试中得分低于 50% —— 由人工分析和 IBM 推出
ITBench-AA 是一个针对企业级自动化 IT 任务的新基准测试,首次评估前沿模型在 Site Reliability Engineering 任务中的表现,结果显示所有前沿模型得分低于 50%,其中 Claude Opus 4.7 表现最佳,为 47%。
入选理由:Claude Opus 4.7 在 ITBench-AA 中表现最佳,得分为 47%
概念
评估模型在企业 IT 任务中表现的基准测试。
最近变化
2026-05-28 · Qwen3.7-Max 在 ITbench-AA 测试中表现优异,排名第三。
ITbench-AA 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
已收录 2 篇与「ITbench-AA」相关的 AI 资讯和分析。
ITBench-AA 是一个针对企业级自动化 IT 任务的新基准测试,首次评估前沿模型在 Site Reliability Engineering 任务中的表现,结果显示所有前沿模型得分低于 50%,其中 Claude Opus 4.7 表现最佳,为 47%。
入选理由:Claude Opus 4.7 在 ITBench-AA 中表现最佳,得分为 47%
Qwen3.7-Max 在 ITbench-AA 基准测试中排名第三,该测试评估模型处理企业级 IT 任务的能力。
入选理由:Qwen3.7-Max 在 ITbench-AA 测试中表现优异,排名第三。
与「ITbench-AA」经常一起出现的 AI 术语。
💡 想追踪「ITbench-AA」的长期趋势?去 实体雷达 · ITbench-AA 查看详细分析和跨材料问答。