ARC Prize

ARC Prize 2025 Results and Analysis

8.5内容质量
ARC Prize 2025 Results and Analysis

TL;DR · AI 摘要

ARC Prize 2025竞赛结果揭晓,商业模型和开源解决方案在ARC-AGI-2基准测试中取得显著进展。

核心要点

  • NVARC团队以24.03%得分获得冠军,任务成本仅$0.20/task。
  • 商业模型Opus 4.5在ARC-AGI-2得分37.6%,但成本达$2.20/task。
  • 论文奖项中,A. Jolicoeur-Martineau的'Less is More'获得$50k奖金。

结构提纲

按章节快速跳转。

  1. 宣布ARC Prize 2025竞赛结果及AGI进展分析。

  2. 1,455支队伍提交15,154份方案,NVARC团队创SOTA记录。

  3. 商业模型Opus 4.5和Poetiq方案在ARC-AGI-2取得突破性表现。

  4. 所有获奖方案和论文均实现开源,推动AGI技术发展。

  5. 列出高分团队和论文奖项得主及其具体成果数据。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • ARC Prize 2025结果分析
    • 竞赛进展
      • NVARC团队冠军
      • 15,154份参赛方案
    • 行业进展
      • Opus 4.5模型
      • Poetiq优化方案
    • 开源成果
      • 所有方案开源
      • 论文奖项扩大

金句 / Highlights

值得收藏与分享的关键句。

#ARC Prize#AGI#AI模型#竞赛结果
打开原文

ARC Prize 2025 结果与分析 | ARC Prize

作者:

Mike Knoop

发布日期:

2025年12月5日

ARC Prize 2025 结果与分析

精炼循环之年

我们正式结束了 ARC Prize 的第二年!尽管大奖尚未有人获得,但我们很兴奋地宣布 ARC Prize 2025 的得分冠军和论文获奖者,并分享基于 ARC-AGI 在 2025 年的最新分析。

#### 比赛进展

首先来看 Kaggle 比赛结果。总计有 1,455 支团队提交了 15,154 份作品参与 ARC Prize 2025 比赛,与 2024 年的 ARC Prize 几乎相同。Kaggle 最高得分冠军在 ARC-AGI-2 私有数据集上实现了 24% 的新 SOTA(最先进水平),每任务成本仅 0.20 美元。

我们还收到了 90 篇论文投稿,较去年的 47 篇显著增加——其中许多论文表现非常出色!鉴于论文质量极高,我们决定扩大论文奖项范围,新增 5 名亚军和 8 个荣誉提名。

我们自豪地宣布:所有 ARC Prize 2025 获胜方案和论文均为开源。

#### 行业进展

2025 年,商业前沿 AI 系统和定制化模型精炼方案在 ARC-AGI-2 上取得了实质性进展。截至目前,最高验证商业模型 Opus 4.5(Thinking,64k)每任务成本 2.20 美元,得分 37.6%。最高验证精炼方案由 Poetiq 基于 Gemini 3 Pro 构建,每任务成本 30 美元,得分 54%。

过去一年中,ARC-AGI 被 OpenAI、xAI、Anthropic 和 Google DeepMind 这四大 AI 实验室用于模型卡片中,以评估前沿 AI 推理能力。

2024 年,ARC-AGI 基准测试标志着"AI 推理系统"的出现,并推动了早期分析。我们才刚刚开始部署这种新科技,我们认为其重要性可与大语言模型(LLM)的发明相媲美。ARC 帮助我们理解了这种新范式的能力和扩展速度。

如今在 2025 年,ARC-AGI 正被用于演示"精炼循环"。从信息论角度看,精炼就是智能。尽管我们仍需要新思路来实现通用人工智能(AGI),但 ARC 已催生了若干开源精炼方法(详见下文)。我预计这些方法将在 2026 年推动 AI 推理取得更大进展。

现在,让我们认识今年比赛进展奖项的获奖者。

ARC Prize 2025 获奖者

高分榜单

| 排名 | 奖金 | 团队 | ARC-AGI-2 私有评估得分 | 来源 | |------|------|------|------------------------|------| | 1st | $25k | NVARC | 24.03% | [代码](#) | [论文](#) | [视频](#) | | 2nd | $10k | the ARChitects | 16.53% | | | 3rd | $5k | MindsAI | 12.64% | [Writeup](#) | | 4th | Lonnie | 6.67% | | | 5th | G. Barbadillo | 6.53% | [Kaggle 上查看](#) |

论文奖项

| 作者 | 标题 | 奖金 | |------|------|------| | A. Jolicoeur-Martineau | Less is More: Recursive Reasoning with Tiny Networks | $50k | [论文](#) | [访谈](#) | | J. Pourcel, C. Colas & P. Oudeyer | Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI | $20k | [论文](#) | | I. Liao & A. Gu | ARC-AGI Without Pretraining | [论文](#) | | 亚军 | $2.5k | I. Joffe & C. Eliasmith | Vector Symbolic Algebras for the Abstraction and Reasoning Corpus | [论文](#) | | J. Berman | From Parrots to Von Neumanns: How Evolutionary Test-Time Compute Achieved State-of-the-Art on ARC-AGI | [论文](#) | | E. Pang | Efficient Evolutionary Program Synthesis | [论文](#) | | E. Guichard, F. Reimers, M. Kvalsund, M. Lepperød & S. Nichele | ARC-NCA: Towards Developmental Solutions to the Abstraction and Reasoning Corpus | [论文](#) | | M. Ho 等 | ArcMemo: Abstract Reasoning Composition with Lifelong LLM Memory | [论文](#) |

#### 荣誉提名

| 作者 | 标题 | |------|------| | K. Hu 等 | ARC-AGI is a Vision Problem! | [论文](#) | | D. Franzen, J. Disselhoff & D. Hartmann | [论文](#) |

专家与大语言模型的结合:在ARC中提升性能是视角问题

探索搜索与学习在ARC25挑战中的结合

A. Das, O. Ghugarkar, V. Bhat & J. McAuley

超越暴力破解:用于ARC-AGI-2的神经符号架构

R. McGovern

微型递归模型的测试时适应

P. Acuaviva 等

重新思考视觉智能:视频预训练的启示

J. Cole & M. Osman

不要因小失大:如何以及为何在ARC中使用深度学习

I. Sorokin & Jean-François Puget

NVARC对ARC-AGI-2 2025的解决方案

优化循环

2025年推动通用人工智能(AGI)进展的核心主题是优化循环。本质上,优化循环通过迭代将一个程序转换为另一个程序,目标是根据反馈信号逐步优化程序以实现目标。

两个案例来自进化测试时计算(J. Berman)和进化程序合成(E. Pang)。Berman的方法通过自然语言驱动进化搜索框架,动态演化ARC解决方案程序。Pang的方法则在Python中实现相同目标,并动态创建程序抽象库以引导合成过程。

在这两种方法中,均采用两阶段优化流程。首先进行探索(生成大量候选方案),然后进行验证(分析程序以生成反馈信号)。该过程按任务循环重复,直至最终程序完全优化并能准确回答所有训练输入/输出对。

零预训练深度学习方法

优化循环正在成为深度学习模型训练的新范式基础。

传统上,深度学习模型通过梯度下降在输入/输出对上训练,生成静态神经网络。这种训练算法逐步优化网络潜在空间中的高维曲线。推理时,网络通过前向传播沿该曲线逼近输出。这一基本概念结合测试时适应和数据增强,是2024年(ARChitects)和2025年(NVARC)ARC竞赛冠军方案的核心。

我们现在看到一种截然不同的训练方法初见成效,该方法直接训练神经权重以表示任务求解程序。输入/输出对仍作为真实标签使用,优化循环在训练中发挥关键作用,与程序合成方法类似——但这次是在权重空间中进行。

该方法具有两个显著特性:

  • 相对于其在ARC-AGI上的表现,生成的网络规模极小。
  • 所有任务特定的训练均在测试时完成。

#### 开源示例

##### 微型递归模型(TRM)

微型递归模型(TRM)

例如,获得论文奖第一名的微型递归模型(TRM)(Alexia Jolicoeur-Martineau),该模型在早期分层推理模型(HRM)工作基础上,仅使用700万参数网络便在ARC-AGI-1上达到45%测试准确率,在ARC-AGI-2上达到8%。根据论文:

/think

TRM 通过一个微型网络递归地优化其预测答案 y。它从嵌入的输入问题 x、初始嵌入答案 y 和潜在变量 z 开始。在最多 Nsup = 16 次优化步骤中,模型尝试改进答案 y。具体通过两个步骤实现:i) 在给定问题 x、当前答案 y 和当前潜在变量 z 的条件下,递归地更新潜在变量 z 共 n 次(递归推理);ii) 在给定当前答案 y 和当前潜在变量 z 的条件下,更新答案 y。这种递归过程使模型能够以极高的参数效率逐步优化答案(可能修正先前答案中的错误),同时最小化过拟合风险。

##### CompressARC

CompressARC

另一个创新案例是 CompressARC(论文奖第三名,Isaac Liao),该方案仅引入 76,000 个参数,却在 ARC-AGI-1 评估数据集上实现了 20% 的准确率,使用单块 RTX 4070 显卡处理每个谜题约需 20 分钟。

该方案具有以下特点:

  • 无需预训练。模型采用随机初始化并在测试时进行训练。
  • 无需数据集。单个模型仅针对单一目标任务进行训练并输出答案。
  • 无需分支搜索。仅使用梯度下降法。

该方法通过在测试时最小化每个任务的描述长度(基于 MDL 原理)实现优化。Liao 推导出如何通过带有解码器正则化的变分自编码器(VAE)损失函数,替代组合搜索来优化极其微型的神经网络程序。这类微型网络的泛化能力令人印象深刻。

#### 商业应用实例

我们在商业人工智能推理系统中也观察到迭代"优化"的证据。思维链可以被解释为一种自然语言程序,将一种潜在状态转换为另一种潜在状态。

以 ARC-AGI 任务 #4cd1b7b2 为例,Gemini 3 Pro 仅使用 96 个推理 token 即可解决问题,而 Gemini 3 Deep Think 需要 138,000 个。这些系统的高级推理模式与推理 token 数量(程序长度)存在强相关性,即使在不需要时也是如此。

这些更长的自然语言程序允许进行更多优化(进一步探索和验证)。

以下是我们实际观察到的推理分析输出示例:

…这未能满足完整的集合要求。这表明当前解决方案可能未完全满足谜题的约束条件。我需要重新检查盒子配置并探索替代排列方案…(Claude Opus 4.5)

…这表明需要进一步调查以完成分析。我将验证第 9 行第 15 列的中心点…(Claude Opus 4.5)

…也许每个输入行在输出中被复制了三次,但这样如何与其余部分匹配?等等,第三输出行是…(QwQ 32B)

2025 年底发布的前沿商业模型(如 Gemini 3、Claude Opus 4.5 等)的一个重要发现是:可以在应用层添加优化循环,以实质性提升任务可靠性,而不仅仅依赖供应商的推理系统。这仍然要求基础模型具备对任务领域知识的覆盖能力。

#### 模型优化

我们已在排行榜中新增了一个类别,名为“模型优化”,并验证了由Poetiq开源的最新Gemini 3 Pro优化版本。该优化在ARC-AGI-2任务上的性能从基准值31%($0.81/任务)提升至54%($31/任务)。值得注意的是,Poetiq报告称,同一模型优化在Claude Opus 4.5上也实现了类似改进,准确率可与Gemini 3 Pro(Ref)相媲美,但每任务成本约为后者的两倍(~$60/任务)。

目前我们看到的优化方案多为领域特定型。但通过GEPA和DSPy等技术,可以在应用层开发通用型可靠性改进方案(前提是具备能生成反馈信号的验证器或环境)。

我们预计这类通用优化和工具改进最终会集成到商业AI系统的API接口层。同时我们也认为,前沿的、任务特定的准确性提升仍将依赖于应用层的知识专业化和验证器。

AGI进展与ARC的未来

截至2025年,随着AI推理系统的出现,具备以下两个特征的任务领域已能被可靠自动化——无需新科学突破:

  • 基础模型具备足够的任务知识覆盖
  • 任务能提供可验证的反馈信号

当前AI推理性能与模型知识密切相关。

此刻我们应当意识到这一点有多么反直觉!人类推理能力并不受知识限制,这种特性带来了诸多奇怪的推论,也导致了"锯齿状智能"等不精确类比。

今年已有大量证据支持这一观点,包括ARC-AGI-2(静态抽象推理)、2025年IMO金牌(数学)和2025年ICPC 100%(编程)的成绩,这些都由AI推理系统取得。这些任务领域显著宽于纯LLM擅长的狭窄领域,但就全球范围而言仍属相对狭窄的领域。

尽管如此,今年AI能力的这一重大升级仍具有深远意义。思维链合成技术的发明与扩展堪比Transformer的发明与扩展。然而我们仍处于早期阶段,很少有人直接体验过这些工具。根据OpenAI的数据,仅有约10%的ChatGPT免费用户曾使用过"思考"模式。我预计当前技术的普及(即使仅在商业领域)仍需5-10年时间。

LLMs的两大突破:

收集领域知识并构建验证器并非易事。这是一项相对昂贵且专业的工作。目前AI自动化是社会投入所需人才、算力和数据意愿的函数。我预计未来12-24个月内,随着社会在全球范围内寻找哪些问题(1)最重要且(2)符合成本阈值,将不断涌现令人振奋的新成果。

这包括早期成果,即AI系统在知识覆盖良好的领域产生新的科学知识。就在本周,Steve Hsu发表了一篇使用生成器-验证器AI优化循环在量子物理领域创造新成果的案例。

然而,许多(甚至大多数)潜在可自动化的难题目前仍超出社会成本阈值。随着工程技术的进步,成本将下降,从而为更多领域开启自动化可能性。从更宏观的角度来看,能够高效适应并产生范式转变创新的机器,仍属于科幻范畴。

对于ARC-AGI-1/2格式,我们认为大奖准确率差距现在主要受工程瓶颈限制,而效率差距仍受科学和理念瓶颈制约。ARC Prize代表开放AGI进展,正如我们此前承诺的,将在2026年继续举办ARC-AGI-2大奖竞赛,以追踪完全开放且可复现解决方案的进展。

尽管AI推理系统表现优异,但它们仍存在许多AGI所需的缺陷和低效之处。我们仍需要新理念,例如如何分离知识与推理等。同时,我们也需要新基准来突出这些新理念的出现。

对知识的过拟合

机器学习中有一个概念称为过拟合。传统上,这发生在模型从训练数据中学习过多时。模型会记忆具体数据而非学习一般规律,导致在测试时对未见过的数据表现不佳。

由此引发的常见AI基准批评是:模型提供方有动机通过"基准最大化"或"训练到测试"来作弊,以在营销中报告高基准分数,但这些分数无法推广到实际应用场景。

ARC-AGI-1和ARC-AGI-2通过使用私有数据集进行官方评分和验证,被设计为对这种类型的过拟合具有抵抗力。

AI推理系统以反映真实进展的方式改变了游戏规则。它们展示了非零流体智能,并且当基础模型扎根于更广泛领域时,能够适应远离其精确知识的任务。

这意味着即使精心设计的基准能够抵抗直接记忆,如果公共训练集和私有测试集过于相似(例如IDD),且模型在大量公共领域数据上训练,这些基准仍可能被"过拟合"。

我们相信ARC-AGI-1和ARC-AGI-2正在发生这种情况——无论是偶然还是有意为之,我们无法确定。

来自我们Gemini 3验证的一个证据:

…目标是绿色(3)。模式是品红(6)实心。结果:品红方块在绿色上…(Gemini 3深度思考)

我们的LLM验证工具没有提及ARC任务或颜色格式,但模型在推理中使用了(正确!)ARC颜色映射。这强烈表明ARC数据在底层模型中得到了良好体现——仅凭二维整数数组的结构和格式,就足以做出正确的ARC推理。

新的元问题

虽然我们认为这种新型"过拟合"正在帮助模型解决ARC问题,但不确定具体程度。无论如何,ARC-AGI-1和ARC-AGI-2格式已为AI推理进展提供了有用的科学预警指标。但基准设计需要在未来进行适应。

事实上,过去两年ARC Prize给我带来的更广泛教训是:最有价值和有趣的基准是由那些从根本上希望推动进步的团队创建的。

推动进步需要深入研究底层技术,你必须愿意关注缺陷并推动行动,随着技术进步不断调整自身,并且每年都要持续这样做。构建优秀的基准测试需要持续努力。

关键词是“适应”。适应是智能的核心模式。这一过程不仅仅是创建优秀的基准测试,更是衡量通用智能本身的终极标准。

引述 Francois Chollet 去年十二月的话:

当为普通人类简单但对AI困难的任务设计变得完全不可能时,你就会知道AGI已经实现了。

ARC-AGI 的方法论:通过迭代改进基准测试来缩小“对人类简单,对AI困难”的差距,从而推动技术进步。

那么,我们是否已经拥有AGI?尚未实现。我们正在全力以赴准备 ARC-AGI-3,计划于明年年初发布,对新格式感到非常兴奋,我们认为这将需要全新的思路!

ARC-AGI-3

过去6个月,我们内部全力专注于开发 ARC-AGI-3。与所有ARC版本一样,它被设计为“对人类简单,对AI困难”,同时是最具科学价值和趣味性的AGI基准测试(并指明我们仍需突破的障碍)。我们正在构建数百款前所未见的游戏。

ARC-AGI-3 测试在全新环境中进行的创新推理能力。

我们计划于2026年初与ARC Prize 2026一同发布ARC-AGI-3。这个新版本是自2019年ARC首次推出以来的首次重大格式变更。前两个版本侧重静态推理,而第三个版本旨在挑战交互式推理,需要全新的AI能力才能成功。

  • 探索
  • 规划
  • 记忆
  • 目标获取
  • 对齐

早期的人类测试和AI研究结果令人鼓舞。我们正在将ARC-AGI-2的教训融入设计,使其对研究人员尽可能有用。

效率是衡量智能的另一个核心概念,我特别兴奋的是ARC-AGI-3的评分指标将首次为我们提供人类与AI行动效率(即学习效率)的正式对比。

我们很快将分享更多关于ARC-AGI-3的信息。在此期间,[在此注册更新](#),[了解更多关于ARC-AGI-3的信息](#),[试玩预览游戏](#)!

2025年获奖者访谈

#### 最高分榜单

  1. 第一名:NVARC

基于改进的建筑师风格测试时训练模型和TRM组件的合成数据驱动集成系统,在竞赛约束条件下于ARC-AGI-2达到约24%。

  1. 第二名:ARChitects

一个具备二维感知能力的掩码扩散LLM,通过递归自我优化和基于视角的评分机制,实现了顶级的ARC-AGI-2性能,显著优于团队2024年的自回归系统。

  1. 第三名:MindsAI

一个高度工程化的测试时训练流水线,结合TTFT、增强集成、分词器丢弃和一些新的预训练技巧,实现了具有竞争力的15.42% ARC-AGI-2得分。

#### 论文奖项

  1. 第一名:Alexia Jolicoeur-Martineau

Tiny Recursive Model(TRM)是一个约700万参数的单网络递归模型,包含独立的答案状态和潜在状态,通过深度监督优化,在ARC-AGI-1达到约45%,在ARC-AGI-2达到约8%。

2nd Place: Julien Pourcel 等人。SOAR 是一个自我改进的进化程序合成框架,通过在其自身的搜索轨迹上微调大语言模型(LLM),在不使用人工设计的领域特定语言(DSL)或解决方案数据集的情况下,将开源 ARC-AGI-1 解决方案的性能提升至 52%。

3rd Place: Isaac Liao 等人。CompressARC 是一个基于最小描述长度(MDL)原理、单谜题训练的神经代码高尔夫系统,在 ARC-AGI-1 上达到 ~20–34% 的性能,在 ARC-AGI-2 上达到 ~4% 的性能,且无需任何预训练或外部数据。

2025 年总结

没有 ARC Prize 团队的全力支持、Kaggle 的竞赛合作伙伴以及我们的赞助商,ARC Prize 的成就将无法实现。我们继续提升自己的雄心壮志,而每个人也都迎难而上,共同应对挑战。

我要特别感谢社区成员的奉献精神。尤其感谢 Mark Barney 和 Simon Strandgaard 持续致力于构建工具、解答问题并为社区提供资源支持。

感谢所有前沿人工智能实验室的成员,他们在 2025 年与我们合作,在 ARC-AGI 上验证了他们的新 AI 系统。

同时,我要向 ARC Prize 主席 Greg Kamradt 表达巨大的感谢。我非常感激他去年接受这一职位。没有他每日不懈的推动和坚持,我们无法取得今天的成就。

特别感谢创始团队成员 Bryan Landers,他持续支持并为 ARC Prize 做出贡献,并在今年关键时刻发挥了重要作用。

最后,感谢我的联合创始人兼 ARC-AGI 创造者 Francois Chollet,与我共同启动了 ARC Prize 和 Ndea。

我们为所有在 ARC-AGI 上提出新想法的人感到鼓舞。我们为 ARC 在人工智能研究前沿产生的影响感到自豪。我们坚信,最终构建通用人工智能(AGI)的团队,今天正在思考 ARC。我们将继续引领这一关注,成为通向 AGI 的最佳指引星。

如果您有兴趣加入 ARC Prize,为实现 AGI 做出贡献,请查看我们的开放职位或联系 team@arcprize.org。