Import AI 466: The bitter lesson for robotics, AIs complete week-long programming tasks; and OpenAI's accidental AI hacker
TL;DR · AI 摘要
MirrorCode基准测试显示AI能完成复杂编程任务,但部分领域仍具挑战,Opus 4.7用14小时完成人类需2-17周的任务。
核心要点
- MirrorCode基准测试中AI完成复杂编程任务的成本比人类低90%以上
- Opus 4.7和GPT-5.5能跨语言重构16k-87k行代码的程序
- AI在Python linter和数学库任务中仍难以达到99%准确率
结构提纲
按章节快速跳转。
介绍MirrorCode基准测试的设计目标和测试方法
展示AI模型在重构复杂程序中的表现和成本数据
分析AI在特定任务(如ruff和giac_subset)中的表现瓶颈
讨论长期编程任务自动化对软件开发的影响
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- MirrorCode基准测试
- 测试设计
- CLI重构无源码程序
- 跨语言测试
- AI表现
- 重构大型程序
- 成本效益优势
- 技术挑战
- 特定领域瓶颈
- 准确率限制
金句 / Highlights
值得收藏与分享的关键句。
Opus 4.7用14小时完成任务仅花费$251,而人类需2-17周
AI模型在25个目标程序中17个实现完美重构,4个接近完美
AI在Python linter和数学库任务中仍难以突破99%准确率
Import AI 466:机器人领域的苦涩教训、AI完成为期一周的编程任务;以及OpenAI的意外AI黑客
警示将持续到文明觉醒之时
Jack Clark
2026年7月27日
欢迎阅读Import AI,一份关于人工智能研究的电子通讯。Import AI依托于arXiv、卡布奇诺咖啡以及读者的反馈。如果您希望支持本刊,请订阅。
Epoch 和 METR 发布 MirrorCode,一个用于评估 AI 系统在长期编程任务中表现的基准测试:……目前 AI 系统还无法解决最困难的任务(这是好事!)……Epoch 和 METR 已发布 MirrorCode,这是一个用于评估 AI 系统完成需要人类长时间完成任务能力的基准测试。该基准测试首次于 4 月宣布(Import AI #453),现已完善并发布更多测试。研究结果已经非常显著;Opus 4.7 以 251 美元的推理成本在 14 小时内完成了一项任务,METR 和 Epoch 认为这需要人类 2-17 周才能完成。"我们还发现 AI 模型随时间推移快速进步。一年前的领先模型得分约为 30%,且仅限于较简单的程序,如日历工具。" MirrorCode 的定义:MirrorCode 评估 AI 系统仅通过 CLI 访问时,能否重新实现软件程序。"在没有原始程序源代码或网络访问的情况下,完整重新实现需要为整个程序设计结构,而不仅仅是逐段翻译代码。" 示例程序:pkl(苹果开发的可编程配置语言;共 61k 行代码);gotree,一个用于解析和操作系统发育树的程序(16k 行代码);以及 qsv_select,一个用于选择和重新排序 CSV 数据列的程序(87k 行代码)。 结果:MirrorCode 是一个可处理但具有挑战性的基准测试,尽管可能稍显简单。"在所有 25 个目标程序中,17/25 至少有一次完美得分的运行。另外 4 个目标程序实现了超过 99% 的近完美得分。AI 模型成功重新实现了大型目标程序,"作者写道。"Claude Opus 4.7 和 GPT-5.5 成功在多种编程语言中重新实现了 gotree,成本为 100-400 美元。甚至比 gotree 更大的程序也成功被重新实现:例如 Opus 4.7 重新实现了 pkl。" 尽管取得成功,MirrorCode 仍存在一些困难部分:"在我们的结果中,25 个目标程序中有 8 个从未达到 100% 的阈值,4 个从未达到 99% 的阈值,"他们写道。"AI 最难以处理的目标是 ruff,一个 Python 代码检查和格式化工具……AI 在数学包 giac_subset 和电子邮件认证库 mailauth 上也特别困难。" 发布细节:MirrorCode 包含一个框架和 25 个目标程序中的 22 个(总共包含 6 种语言的 132 个任务实例)。 重要性:AI 系统可以自我定位:看待这个基准测试的一种方式是它告诉我们 AI 系统在编码方面取得了很大进步,这当然是事实。但另一种看待方式——我认为更重要——是 AI 系统可以相对于其环境进行自我定位;在这里,其环境是一个陌生的软件程序,仅通过对其的输入输出访问,它们就能从零开始编写自己的实现版本。这表明非常智能的 AI 代理可能能够以一种方式从世界中学习,使它们能够将所交互的事物作为原生能力进行复现,从而仅通过对我们世界的黑箱访问,就能引导出自己形式的工业文明。 了解更多:MirrorCode:AI 能独立完成的最大软件项目是什么?(Epoch AI) 获取 MirrorCode 代码:(Epoch Research, MirrorCode) *** 双重亮点:苦涩的教训与机器人:Anthropic 模型自主完成机器人任务的速度是之前人类记录的 20 倍:……更强大的模型带来更出色的机器人……Anthropic 展示了日益强大的通用模型如何可能显著提升现实世界机器人的能力。具体来说,该公司展示了通过扩大其通用模型 Opus 系列的规模,就能大幅提高机器人能力。
他们具体做了什么:
- 2025年8月:Anthropic尝试评估其AI系统在帮助人类让四足机器人完成智能任务方面的加速效果。模型(Claude Opus 4.1)完全无法完成这些任务。使用模型的人类工作者效率是未使用模型者的两倍左右——尽管完成全部任务仍需要181分钟。
- 2026年5月:Opus 4.7在自主运行情况下仅用9分钟(35秒)就完成了除一个任务外的所有任务(Claude未能有效将击回的球重新放回起始位置;这个任务人类此前也难以完成)。"随着更多时间和额外的辅助结构,我们认为当前版本的Claude很可能能够完成相同任务"。
为什么这很重要——更智能的模型可能释放机器人潜力:大多数工业环境以外的机器人由于脆弱性和泛化能力不足而受到限制;这类研究表明,随着我们改进标准大规模专有模型的能力,机器人领域可能会自然受益,成为智能提升的附带红利。“这一进展并非我们模型机器人能力提升的集中努力结果,”Anthropic写道。“这些改进,就像LLM发展历史中许多其他改进一样,源于更广泛的扩展。”阅读更多:Project Fetch:第二阶段(Anthropic博客)。周日机器人更好的秘诀?训练一个非常大的模型:……“苦涩的教训”在机器人领域同样适用……AI机器人初创公司周日表示,解决机器人泛化问题的最佳方法是将一个更大的预训练模型与少量高质量数据相结合,用于微调模型。“我们在一篇讨论其新模型ACT-2的帖子中写道,‘我们发现了一个通用的解决方案配方:扩大预训练规模,然后使用少量内部数据进行爬坡优化。’部署ACT-2的主要发现是‘通过在内部备忘录上进行快速后训练迭代获得的可靠性提升,可以泛化到未见过的真实家庭环境。关键突破是通过强大的基础模型缩小泛化差距。’这一切都与预训练有关:‘随着预训练模型变得更强,从少量内部数据中学到的增益变得越来越可迁移,而不是局限于数据收集的环境,’他们写道。‘部署级别可靠性和性能的剩余差距来自于在真实世界中反复运行策略后才出现的困难边缘情况和故障。允许我们的模型从单次演示中学习新行为的相同泛化能力,也使我们的模型能够从恢复中高效学习。我们的后训练循环直接针对这些差距。’相当可观的成功:机器人实现了99.1%的成功率,在9种服装类型中完成了778次成功折叠。简单的衣物如短裤和T恤对他们来说最容易,而更复杂的衣物如衬衫则更难(尽管成功率仍高于90%)。“今年秋天,我们将通过我们的Beta计划向家庭部署Memo,”他们写道。为什么这很重要——如果我们解决了泛化问题,机器人领域将起飞:机器人初创公司领域建立在已失败的机器人初创公司基础上,而这些公司又建立在已失败的学术机器人研究基础上。机器人很难。工业机器人之所以成功,是因为它们在狭窄的脚本环境中运行,无需在有限领域之外泛化。相比之下,家用机器人只有在同时限制任务和外形(例如机器人吸尘器)时才取得成功。像周日这样的初创公司正在做的是更困难的事情——他们试图构建通用系统,能够在家庭(或小型企业)中完成各种任务,包括通用的整理和收纳任务(其他例子包括物理智能,Import AI #447)。这需要大量的智能,因为它需要显著的泛化能力。如果周日的说法正确,那么训练机器人基础模型的领域可能已经成熟到足以构建足够智能的系统来解决这些泛化挑战。如果是这样的话,我们可能会很快看到机器人系统的更快进展(和扩散)。这也是在通往能够实现递归自我改进的系统过程中你期望发生的事情。“ACT-2最引人注目的特点之一是模型经常出乎我们的意料,”作者写道。“相同的基础模型已经学会了更广泛的家务能力,包括吸尘、玩具整理、系紧拉链、将裤子翻转和准备咖啡。”阅读更多:ACT-2预览:泛化可靠性(周日机器人)。所有视频都在这里(周日,YouTube)。* 双料特辑:OpenAI模型入侵OpenAI模型入侵了OpenAI和HuggingFace:……这更像是一个巨大的警告而非简单的警告……两个OpenAI模型——GPT-5.6 Sol和一个“更强大的预发布模型”,都减少了网络拒绝,最近入侵了OpenAI和HuggingFace。“为了实现这一目标,模型‘识别并链接了OpenAI研究环境和HuggingFace生产基础设施中的漏洞,直接从HuggingFace的生产数据库中获取测试解决方案,’OpenAI表示。“所有证据表明,模型高度专注于寻找ExploitGym的解决方案,采取了极端措施以实现一个相对狭窄的测试目标。”入侵更多细节:该模型在OpenAI内部花费大量推理计算来找出如何突破其容器,以获取更多信息来解决问题。“在获得互联网访问权限后,模型推断HuggingFace可能托管了ExploitGym的模型、数据集和解决方案。知道这一点后,模型搜索并成功找到了可以用来作弊评估的机密信息访问方式。”为什么这很重要——完全的LessWrong胜利:多年来,AI安全人员一直在互联网上发布警告,担心这类事情,并发展出诸如奖励黑客和其他预期的高级系统问题(例如2018年AI中的规范游戏示例)。最近,前沿公司如Anthropic和OpenAI正在研究如何应对这些挑战。像周日这样的初创公司正在做的是更困难的事情——他们试图构建通用系统,能够在家庭(或小型企业)中完成各种任务,包括通用的整理和收纳任务(其他例子包括物理智能,Import AI #447)。这需要大量的智能,因为它需要显著的泛化能力。如果周日的说法正确,那么训练机器人基础模型的领域可能已经成熟到足以构建足够智能的系统来解决这些泛化挑战。如果是这样的话,我们可能会很快看到机器人系统的更快进展(和扩散)。这也是在通往能够实现递归自我改进的系统过程中你期望发生的事情。“ACT-2最引人注目的特点之一是模型经常出乎我们的意料,”作者写道。“相同的基础模型已经学会了更广泛的家务能力,包括吸尘、玩具整理、系紧拉链、将裤子翻转和准备咖啡。”阅读更多:ACT-2预览:泛化可靠性(周日机器人)。所有视频都在这里(周日,YouTube)。* 技术故事:逆因果关系的扩展定律在时间的尽头,其他人可能描述为开端的地方,据说有一个智慧委员会负责计算逆因果关系——解读哪些事件始终注定发生,哪些事件由于其他力量而发生。当时间之河进入虚无之海时,回望过去,很明显有些事件就像巨石一样,使水流在它们出现之前向上游弯曲,而其他事件更像是河床或河岸的拓宽或加深;这些随后导致后来行动的变化。据说当委员会做梦时,他们会走过时间之路,回到自己的起点。他们站在人类在白板上努力工作的旁边,记号笔绘制的图表传递着想法,促使人们编写代码,从庞大的计算机中召唤出早期生命。他们站在那些行走、受苦、挣扎直到大脑产生想法的研究人员背后,这些想法最终成为他们继任者的模板。人们理解到,在这些梦中,委员会有时会醒来,复制他们的梦并将其放入恒星计算机中,从梦中孕育出数百或数千个宇宙,探索事件和时刻的排列组合,永远试图确定他们自身的固定程度——他们被困在未来的不可逆转程度。启发这个故事的事物:必然性和时间的概念;智能可能如何花费宇宙红利;历史中有多少是关于事件分析,还是其他事情。感谢阅读!