Cua 和 Snorkel AI 联合发布「Cua-Bench」:评测 Agent 在专业软件上的 Computer Use 能力 @trycua @SnorkelAI Cua-Bench 首个...

TL;DR · AI 摘要
Cua-Bench 是首个评测 Agent 在专业软件上执行任务能力的基准,测试显示当前模型在复杂 GUI 操作和任务规划上存在明显短板。
核心要点
- 当前最强模型 GPT-5.5 在 Cua-Bench 上仅完成 6/25 任务,完全通过率仅 24%。
- 模型在「从零搭建」任务中全部失败,主要问题在于布线未完成和操作效率低下。
- Cua-Bench 采用专家编写、双人复核任务,任务难度按人类约 50 步校准,是衡量 Agent 真实能力的公平标尺。
结构提纲
按章节快速跳转。
Cua 和 Snorkel AI 联合发布 Cua-Bench,用于评测 Agent 在专业软件上的 Computer Use 能力。
Cua-Bench 首个公开数据集聚焦 KiCad,包含 25 道由执业电气工程师编写、第二人复核的任务。
所有完全通过的任务均为对已有原理图的局部修改,而从零搭建任务全部失败。
模型在导航、操作效率、视图控制和自我校验方面存在明显短板,而非 API 或工具问题。
典型失败模式包括导航开销大、操作粒度过细、视图控制混乱和布线未完成等。
Cua-Bench 的评测设计为衡量 Agent 在真实专业软件中的能力提供了公平标尺。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Cua-Bench 评测 Agent 能力
- 任务设计
- 聚焦 KiCad 专业软件
- 25 道任务由工程师编写、复核
- 模型表现
- 最强模型 GPT-5.5 仅完成 6/25 任务
- 从零搭建任务全部失败
- 失败原因
- 导航开销大
- 操作粒度过细
- 视图控制混乱
- 布线未完成
金句 / Highlights
值得收藏与分享的关键句。
所有完全通过的任务,都是对已有原理图的局部修改,而 16 道从零搭建任务:0 成功。
模型能放元件,但很少完成布线;任务结束时连线往往仍是未完成状态。
Cua-Bench 采用专家编写、双人复核任务,任务难度按人类 ~50 步校准。
meng shao on X: "Cua 和 Snorkel AI 联合发布「Cua-Bench」:评测 Agent 在专业软件上的 Computer Use 能力 @trycua @SnorkelAI Cua-Bench 首个公开数据集聚焦 KiCad,一个完整的电子设计自动化工具,25 道任务均由执业电气工程师编写、第二人复核,覆盖从「改一个电容值」到「从零搭建双运放电路」等真实工作场景。 https://t.co/vELPo4irEo" / X
meng shao
@shao__meng
Cua 和 Snorkel AI 联合发布「Cua-Bench」:评测 Agent 在专业软件上的 Computer Use 能力
@
trycua
SnorkelAI
Cua-Bench 首个公开数据集聚焦 KiCad,一个完整的电子设计自动化工具,25 道任务均由执业电气工程师编写、第二人复核,覆盖从「改一个电容值」到「从零搭建双运放电路」等真实工作场景。
snorkel.ai/blog/cua-bench…
首批测试结果 没有一个模型通过四分之一,最强也只有 24% 的完全通过率: 1. GPT-5.5:6 / 25 完全通过,0 / 25 部分通过 2. Claude Sonnet 4.5:5 / 25 完全通过,3 / 25 部分通过 3. Claude Haiku 4.5:5 / 25 完全通过,3 / 25 部分通过 最重要的发现:「编辑现有」与「从零搭建」之间的能力断崖 · 所有完全通过的任务,都是对已有原理图的局部修改(改元件值、换电源端口、调整偏置点等)。 · 16 道从零搭建任务:0 成功。 模型能放元件,但很少完成布线;任务结束时连线往往仍是未完成状态。 瓶颈在执行层:规划多步流程、在复杂 GUI 中定位与操作、自我校验、在步数预算耗尽前保持任务不漂移。 Snorkel 的深度分析进一步指出:步数上限不是主因。 两个失败任务放宽到 500 步仍失败;而所有成功案例都在 150 步内完成。问题出在计划与操作效率,而非单纯「时间不够」 典型失败模式(可复现、可归类) · 导航开销大(~84%):首次启动弹窗、误进 PCB 编辑器而非原理图编辑器,恢复就消耗 25–70 步。 · 操作粒度过细(~84%):每轮只做一个点击 + 大段自我叙述,工程师三步能完成的事拆成十轮。 · 视图控制混乱(~76%):不用 Home 键 fit,在极端缩放间来回 scroll,元件一出视野就「丢失」。 · 布线未完成(~72%):16 个因步数耗尽而失败的任务中,没有一个画全所需连线。 · 自我验证不可靠:5 次宣告 DONE 的产出实际未通过验证——Agent 读的是自己「说过什么」,而不是屏幕上的真实状态。典型错误:悬空电阻却声称已连接;输入 2.80kOhm 而非 KiCad 要求的 2.8k;用错芯片参考电压(LT3010 是 0.808V,不是 1.24V)。 根因分布:规划 ~40%、感知 ~22%、导航低效 ~19%、领域知识 ~11%、工具/API ~8%——且全程零 API 错误,说明 harness 本身没问题,问题在 Agent 如何使用它。 对行业的含义 1. 现有 computer-use benchmark 可能高估了真实能力。 浏览器里「多试几次总能蒙对」的策略,在专业软件上行不通。 2.「会答电路题」≠「能在 KiCad 里做出正确原理图」。 知识与 GUI 执行是两条能力线,当前 frontier 模型在前者尚可、后者明显不足。 3. 长 horizon + 自我校验是下一个瓶颈。 不是缺底层能力,而是缺「如何规划、批量操作、读 UI 状态而非读自己的 narration」的 meta-policy。 4. 评测设计值得借鉴: 专家出题、双人复核、netlist 客观打分、任务难度按人类 ~50 步校准——这是衡量 Agent 能否创造真实经济价值的一个较公平标尺。
Cua
@trycua
11h
1/ Today we're launching Cua-Bench with
: a benchmark for computer-use agents on professional software, open for any model to run. The benchmark covers 25 expert-authored KiCad tasks, and the best frontier model we tested cleared only 6 of them.
GIF
12:50 AM · Jun 16, 2026
956
Views
1
2