Anthropic(@AnthropicAI)

New Frontier Red Team blog: Phase 2 of Project Fetch, where we test how well Claude can program a ro...

6.0内容质量

TL;DR · AI 摘要

Anthropic 的 Project Fetch 测试显示,Claude 在编程机器人任务中表现优于人类团队,但机器人仍未能完成任务。

核心要点

  • Claude 在编程任务中比去年的人类团队快 20 倍。
  • Project Fetch 是 Anthropic 的红队测试项目,用于评估 Claude 的编程能力。
  • 机器人未能完成抓取沙滩球的任务,显示实际应用仍存在挑战。

结构提纲

按章节快速跳转。

  1. §Project Fetch 概述

    Project Fetch 是 Anthropic 的红队测试项目,用于评估 Claude 的编程能力。

  2. Claude 在编程任务中比去年的人类团队快 20 倍,但机器人未能完成任务。

  3. 尽管 Claude 表现优异,但机器人仍未能完成抓取沙滩球的任务,表明实际应用仍需改进。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Project Fetch
    • Phase 2
      • Claude 的编程能力测试
      • 机器人任务失败
    • 结果对比
      • Claude 比人类团队快 20 倍

金句 / Highlights

值得收藏与分享的关键句。

#Anthropic#AI#机器人#编程
打开原文

Anthropic 在 X 上的推文: "New Frontier Red Team 博客:Project Fetch 的第二阶段,我们测试 Claude 多么擅长为 robodog 编程。Opus 4.7 独自完成任务的速度是去年由 Opus 4.1 辅助的最佳人类团队的约 20 倍。(可惜,robodog 仍然未能成功接住一个沙滩球。)https://t.co/CgbBtRf85e" / X

Anthropic

@AnthropicAI

New Frontier Red Team 博客:Project Fetch 的第二阶段,我们测试 Claude 多么擅长为 robodog 编程。Opus 4.7 独自完成任务的速度是去年由 Opus 4.1 辅助的最佳人类团队的约 20 倍。(可惜,robodog 仍然未能成功接住一个沙滩球。)

Project Fetch:第二阶段

来自 anthropic.com

2026 年 6 月 18 日 下午 4:52

150.2K

浏览量

2

1

4

214

0

5

105

.

K

1.4K

8

7

287

阅读 214 条回复