ARC Prize

OpenAI's GPT-6 Astra on ARC-AGI-3

8.5内容质量
OpenAI's GPT-6 Astra on ARC-AGI-3

TL;DR · AI 摘要

GPT-6 Astra在ARC-AGI-3基准测试中展现类人级智能,通过特殊Harness实现成本效率优化。

核心要点

  • GPT-6 Astra在Standard Harness下以$26K成本达成62.7%得分
  • Provider Adapter Harness使推理成本降低37%($19K)
  • 模型行动效率超越人类基准96%的关卡

结构提纲

按章节快速跳转。

  1. 揭示GPT-6 AstraARC-AGI-3基准测试中的突破性表现

  2. 介绍第四代AGI基准测试的四个核心评估维度

  3. 解释标准Harness如何通过笔记留存提升推理效率

  4. 阐述适配器Harness通过状态压缩降低37%成本

  5. 对比不同Harness下模型的得分与成本效率关系

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • GPT-6 Astra ARC-AGI-3测试
    • 测试框架
      • ARC-AGI-3基准
      • 四个评估维度
      • 人类100%通关率
    • 技术实现
      • Standard Harness
      • Provider Adapter
      • 状态压缩技术
    • 性能指标
      • 62.7%得分
      • $26K成本
      • 96%关卡效率

金句 / Highlights

值得收藏与分享的关键句。

#GPT-6#ARC-AGI#AI基准测试#Harness技术#AGI
打开原文

OpenAI的GPT-6 Astra在ARC-AGI-3上的表现 | ARC奖

作者 Greg Kamradt 发布日期 2026年9月3日

OpenAI的GPT-6 Astra在ARC-AGI-3上的表现

概述

  • GPT-6 Astra在ARC-AGI-3半私有测试中使用标准适配器(Standard harness)以26,000美元成本获得62.7%的得分,该适配器允许模型在环境中持续保存关键笔记。通过提供商适配器(Provider Adapter harness)以19,000美元成本获得99.9%的得分,该适配器可在请求间保留不透明推理状态,并通过压缩技术支持更长对话,使模型能够复用先前工作。
  • GPT-6 Astra在ARC-AGI-3的动作效率上超越人类基准。在96%的关卡中,其使用的动作数量少于测试人类的中位数。
  • GPT-6 Astra表现出的一项关键行为是其将陌生环境转化为紧凑符号化世界模型的能力。它将游戏机制表示为逻辑规则,并开发了专属领域语言缩写以追踪状态和规划动作。

ARC-AGI-3

ARC-AGI-3是一个通过新颖抽象回合制环境研究智能体智能的基准测试。智能体必须探索环境、推断目标并构建内部模型,以在没有明确指令的情况下有效规划行动。您可亲自体验ARC-AGI-3

您的浏览器不支持嵌入视频。

这些环境仅包含核心先验知识,通过受控的人类参与测试进行难度校准。人类可解决100%的环境。

ARC-AGI系列的目标是衡量当前人工智能与通用人工智能(AGI)之间的“剩余差距”。我们将AGI定义为系统获取人类可掌握技能的能力,且效率与人类相当。

ARC-AGI-3是ARC-AGI基准测试系列的第三代。它测试超越ARC-AGI-1和ARC-AGI-2的智能体能力。每一代都在前代基础上扩展——随着前沿AI能力的发展,我们的基准测试也必须同步进步。

ARC-AGI-3测试智能体智能的四个组成部分:

  • 探索:在现实环境中,信息极少被动提供。智能体必须通过与环境互动主动获取信息。
  • 建模:智能体必须将原始观察转化为可泛化的模型,以预测未来状态和结果。
  • 目标设定:智能体必须仅凭稀疏奖励识别目标未来状态。
  • 规划与执行:智能体必须从当前状态到目标映射路径,并在新信息出现时进行航向修正。

Astra测试结果

GPT-6 Astra在标准适配器和提供商适配器下均在ARC-AGI-3上取得最先进成绩。推理层级越高通常成本越低,因为Astra通过更少动作解决游戏,减少模型调用次数和令牌总量。查看完整结果

使用标准适配器(允许模型在环境中持续保存关键笔记),OpenAI的Astra(最大推理)以26,000美元成本在ARC-AGI-3半私有测试中获得62.7%的得分。使用提供商适配器(可在请求间保留不透明推理状态并支持长对话压缩)时,Astra(高推理)以19,000美元成本获得99.9%的得分。两项均为最先进成绩。查看完整排行榜

在最大推理努力下,Astra更高效地解决游戏,所需动作更少,因此相比其他推理层级显著降低总成本。

推理努力

标准适配器

标准适配器使模型能够在整个环境中保留其选择的笔记。

提供商适配器

提供商适配器在请求之间保留不透明的推理状态,并使用压缩技术处理更长的对话,使模型能够重用之前的工作。

max

62.7%,26,098美元

98.6%,17,332美元

xhigh

59.3%,37,317美元

98.4%,18,147美元

high

54.8%,40,705美元

99.9%,18,817美元

medium

38.6%,48,090美元

98.4%,19,285美元

low

17.5%,38,166美元

98.0%,21,298美元

none

35.2%,49,791美元

96.7%,23,457美元

在成本比较方面,根据我们的受控测试,人类参与者每90分钟的会话获得115美元报酬,每完成一场比赛额外获得5美元。每场会话参与者尝试约九场比赛,每场尝试比赛约12.78美元(不包括奖金)。

这些费用大部分用于支付参与者的参与时间和愿意接受测试的意愿,而非其大脑消耗的能量(这更接近与AI进行比较的指标)。如果我们仅考虑大脑的能量消耗,并将其按电力计价,估算值降至每场会话约0.6美分,或每场尝试比赛约0.067美分。1

分析

除了得分之外,Astra的回放展示了它如何将不熟悉的玩法机制转化为有用的模型。三个发现尤为突出:它开发的紧凑代数符号、与人类相比的动作效率,以及构建的定制工具。

自定义代数符号

在玩ARC-AGI-3时,Astra会选择要保留的策略笔记。它跟踪了物体、坐标、规则和未完成的计划,同时使用为环境生成的自定义领域特定语言符号。

我们在其他模型中也观察到类似行为,但Astra的笔记因其精确性和信息密度而脱颖而出。它将场景提炼成紧凑的代码式符号模型:物体的位置、它们的交互方式,以及需要按什么顺序执行的具体动作。这是一种实时的代数简写而非完整的编程语言。例如:

  • 游戏状态:L8: hub q2 (8↓)。长度:14=1… 记录了关卡、局部旋转索引和机制长度。s5i5,帧219
  • 多步骤计划:extend8 to3;retract10 to2;shorten8 to1 记录了对颜色8和颜色10机制的有序更改序列。s5i5,帧219
  • 控制和坐标:9−=(39,4),rotate=(49,18),14+=(59,11) 将操作映射到执行它们的控制坐标。s5i5,帧235
  • 时间和位置:第5回合:P=(24,20),空,面朝西 将回合计数器与玩家的位置、携带状态和方向结合。wa30,帧708

Astra在s5i5中游玩,使用实时代数简写跟踪状态和规划动作。

与人类相比的动作效率

在启动ARC-AGI-3之前,我们测试了约500名普通公众成员,以建立人类动作效率的基准,即人们解决每个环境的速度。参与者并未根据解谜经验或能力进行筛选。2

对于每个关卡,我们使用完成该关卡的玩家中动作次数的中位数来定义“人类基准”。这为我们比较人类和AI的表现提供了参考。需要更多动作的AI动作效率较低,而需要更少动作的AI动作效率较高。

在 Provider Adapter 框架中,Provider Adapter 框架在请求之间保留不透明的推理状态,并通过压缩机制支持更长时间的对话,使模型能够复用先前的工作。Astra(max)在 96.0% 的关卡中使用的动作少于人类基准,平均每个关卡使用的动作减少了 51.7%。这是一个具有重要意义的里程碑。这意味着按照 ARC-AGI-3 的动作效率衡量标准,Astra 已经达到并超越了人类水平。

作为补充说明,在推出 ARC-AGI-3 之前,我们曾假设动作效率将是人类与人工智能之间的分水岭。我们预计即使人工智能解决了某个环境,可能仍需要比人类进行大量额外探索(动作)。这种现象在暴力破解方法中仍然成立,但前沿人工智能表现出类似二进制的模式。一旦前沿人工智能“理解”了机制,其执行效率通常会进入人类效率范围内。

#### Astra 的动作效率与人类对比

每个点代表 Astra(max)完成的一个关卡。实线以下的点表示使用的动作少于人类基准。

上图将 Astra 完成每个关卡使用的动作数量与我们的人类基准进行了对比。这进一步解释了为什么 ARC-AGI-3 采用动作效率而非仅任务完成率作为衡量标准。仅以任务完成率作为评分标准,只能告诉我们 Astra 完成了某个环境,但无法说明其学习解决任务的效率。

大多数基准仅衡量计算效率(衡量使用的计算资源),而动作效率衡量的是完成任务所需的环境交互次数。

Astra 的结果表明,它在执行解决方案时所需的交互次数少于人类基准。

Agent 框架中的自定义工具

我们还在 PRO-LONG 框架(论文)中对 Astra 进行了评估,这是 ARC-AGI-3 最早的红队合作方之一。在此高级设置中,Astra 可以访问一个沙盒环境,用于执行自定义代码。

我们观察到 Astra 为每个游戏创建了自定义工具集:棋盘解析器、游戏状态模型、搜索算法、规划器和持久化笔记。对于更复杂的任务,Astra 甚至生成了小型的、针对特定游戏的软件库。

例如,在 tu93(一个带有守卫和移动巡逻的迷宫类游戏)中,Astra 最初实现了导航功能并创建了 maze_solver.py。随后在 combat_solver.py 中添加了战斗规则,在 patrol_solver.py 中建模了移动巡逻,并使用 sync_state.py 将预测结果与观测值进行比对。

分析 Astra 在 PRO-LONG 中的表现具有参考价值,因为它展示了其使用外部工具的能力。然而,这与我们受控的人类测试条件存在差异。我们的测试参与者没有代码解释器、草稿纸等工具,因此 PRO-LONG 的结果应被理解为模型与其工具协同工作的综合表现。

Astra 在 PRO-LONG 框架中玩 tu93 游戏。

两种框架,两个问题

ARC-AGI-3 的标准框架要求模型在相同的基础、中立接口下进行比较。该框架提供了解决每个游戏所需的所有信息,但要求模型自行决定在可见笔记中保留哪些内容。我们认为未来的通用人工智能(AGI)应该能够在这些条件下解决 ARC-AGI-3。共享接口还使我们能够对不同供应商进行一致的、可比性更强的评估。

或者,还有一个问题:当模型能够使用其提供商为其设计的上下文管理功能时,模型的表现如何?对于Astra而言,这意味着在请求之间保留不透明的推理状态(我们无法看到)并使用压缩技术来管理更长的对话。

通过Provider Adapter框架,Astra在ARC-AGI-3 Semi-Private测试集上的最佳观察得分从62.7%提升至99.9%。在Public和Semi-Private测试集以及所有推理级别上,Provider Adapter的运行速度比标准框架快约3.66倍(按总耗时计算),在167个游戏推理对中使用的总token数减少了49%。

未来,我们将在ARC-AGI排行榜上同时报告Standard框架和Provider Adapter框架的结果,并对每种评估条件进行明确标注。我们的开源测试仓库和测试政策文档均涵盖了这两种方法。

ARC-AGI系列

ARC-AGI-3仍然是研究人员和智能体探索陌生环境、发现规则并通过交互学习的重要实验场。Astra的成果也是一个值得庆祝的重要里程碑。从我们的角度来看,Astra代表了前沿模型能力的显著跃进。

在发布ARC-AGI-3时,我们明确表示,完全通过该基准测试并不代表"实现AGI的证明"。因此,尽管我们认为Astra在通用性方面取得了实质性进展,但并未声称其已达到AGI水平。

ARC-AGI基准系列的设计目标是与前沿AI技术同步演进。这在新兴研究问题与AI能力进步之间形成了反馈循环。ARC-AGI-3是我们首个交互式基准测试,要求AI高效合成因果世界模型并在没有具体指令的情况下实现目标。Astra成功达到了这一标准。同时,ARC-AGI-3具有严格限定的范围和格式,其环境具有确定性、封闭式机制和目标。它并不能代表现实世界的复杂性和开放性。

我们正在积极探索应塑造下一代基准测试的问题,包括如何评估递归自我改进和开放式创新。Astra的进展有助于明确哪些AI能力尚无法企及,哪些问题仍然开放。

感谢François Chollet、Mike Knoop、Matt Mazur、Ethan Bond和Derek Smith对本文的早期审阅。

  • 假设大脑代谢功率为20W,电价为0.20美元/kWh:0.020kW × 1.5小时 = 0.030kWh,每节课程价值0.006美元,即0.006美元 ÷ 9 ≈ 0.00067美元/次尝试游戏。
  • 参见ARC-AGI-3人类测试论文。
  • 没有观察到试图突破沙盒环境的证据。