Anthropic(@AnthropicAI)
New Frontier Red Team blog: Phase 2 of Project Fetch, where we test how well Claude can program a ro...
6.0内容质量
TL;DR · AI 摘要
Anthropic 的 Project Fetch 测试显示,Claude 在编程机器人任务中表现优于人类团队,但机器人仍未能完成任务。
核心要点
- Claude 在编程任务中比去年的人类团队快 20 倍。
- Project Fetch 是 Anthropic 的红队测试项目,用于评估 Claude 的编程能力。
- 机器人未能完成抓取沙滩球的任务,显示实际应用仍存在挑战。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- Project Fetch
- Phase 2
- Claude 的编程能力测试
- 机器人任务失败
- 结果对比
- Claude 比人类团队快 20 倍
金句 / Highlights
值得收藏与分享的关键句。
Opus 4.7, on its own, was ~20x faster than last year's best human team aided by Opus 4.1.
The robodog, alas, still failed to fetch a beach ball.
Project Fetch: Phase two tests how well Claude can program a robodog.
#Anthropic#AI#机器人#编程
打开原文Anthropic 在 X 上的推文: "New Frontier Red Team 博客:Project Fetch 的第二阶段,我们测试 Claude 多么擅长为 robodog 编程。Opus 4.7 独自完成任务的速度是去年由 Opus 4.1 辅助的最佳人类团队的约 20 倍。(可惜,robodog 仍然未能成功接住一个沙滩球。)https://t.co/CgbBtRf85e" / X
Anthropic
@AnthropicAI
New Frontier Red Team 博客:Project Fetch 的第二阶段,我们测试 Claude 多么擅长为 robodog 编程。Opus 4.7 独自完成任务的速度是去年由 Opus 4.1 辅助的最佳人类团队的约 20 倍。(可惜,robodog 仍然未能成功接住一个沙滩球。)
Project Fetch:第二阶段
来自 anthropic.com
2026 年 6 月 18 日 下午 4:52
150.2K
浏览量
2
1
4
214
0
5
105
.
K
1.4K
8
7
287
阅读 214 条回复