ARC Prize

ARC Prize 2026: ARC-AGI-3 Milestone Prize #1

8.5内容质量
ARC Prize 2026: ARC-AGI-3 Milestone Prize #1

TL;DR · AI 摘要

ARC Prize 2026宣布ARC-AGI-3里程碑奖,Tufa Labs的The Duck方案通过Python REPL实现交互式推理,Reki使用视觉语言模型。

核心要点

  • The Duck方案通过Python REPL实现无限游戏机制,使用Qwen 3.6 27B FP8模型
  • Reki方案采用视觉语言模型Gemma-4-31B处理游戏画面生成JSON动作
  • Tufa Labs发现手工工具反而降低模型表现,多模态处理提升效果

结构提纲

按章节快速跳转。

  1. 宣布ARC-AGI-3里程碑奖及获奖方案

  2. 介绍首个交互式推理基准测试的环境设计与挑战

  3. 解释新设的中期竞赛奖项激励开源解决方案

  4. 分析Tufa LabsReki的技术实现路径

  5. 描述基于Python REPL的多模态交互推理方法

  6. 解析视觉语言模型驱动的策略生成机制

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • ARC Prize 2026里程碑奖
    • ARC-AGI-3基准测试
      • 交互式推理环境设计
      • 长期目标规划挑战
    • 获奖方案
      • The Duck
        • Python REPL实现
        • 多模态感知
      • Reki
        • 视觉语言模型
        • 反射记忆机制

金句 / Highlights

值得收藏与分享的关键句。

#ARC Prize#AGI#基准测试#开源模型#AI竞赛
打开原文

ARC Prize 2026:ARC-AGI-3 里程碑奖 #1 | ARC Prize

作者 Greg Kamradt 发布日期 2026年7月6日

ARC Prize 2026:ARC-AGI-3 里程碑奖 #1

ARC-AGI-3 第一阶段前三名提交方案

ARC-AGI-3 是我们的首个交互推理基准测试。它由一组新颖的、类似视频游戏的环境组成,智能体需要在长期跨度中感知、探索、规划和行动。由于存在隐藏的测试集,这些游戏无法通过记忆来完成。它们奖励即时学习能力、高效探索能力,以及在目标不明确时自主设定目标的能力。对人类来说,解决这些问题既简单又有趣,但对当今的AI而言仍具挑战性。

在2026年ARC Prize中,我们新增了两个里程碑奖项,用于奖励ARC-AGI-3竞赛中表现优异的开源解决方案。这些奖项旨在激发人们尝试新思路,并为推进这些想法创造激励。

我们很激动地颁发首个37,500美元的ARC-AGI-3里程碑奖(截止至6月30日)。以下是我们在ARC-AGI-3 Kaggle竞赛中的前三名提交方案。

第一名 - Tufa Labs,"The Duck"

一个小型开源大语言模型,通过在实时REPL(类似于Duke Harness)中编写并运行Python代码来玩ARC-AGI-3,将每个游戏视为交互式编程问题。

[Notebook](链接) · [Write-up](链接) · [Video](链接) · [Tufa Labs](链接)

该提交方案将游戏状态转换为Python变量,并通过REPL与其交互。该过程包括推理、调用辅助函数、运行代码、采取行动、观察结果并重复。它通过渲染图像、原始ASCII网格和区域缩放分割工具来感知棋盘。它会根据当前情况选择最适合的表示方式。

为了实现无限游戏而不会耗尽上下文窗口,The Duck持续移除最旧的消息("通过驱逐实现无限游戏"),仅保留系统提示和最近的历史记录。团队的哲学是保持框架轻量且通用,让模型主导决策,并报告收益来自于多模态能力和更优的基础模型,而非手工构建的工具。

关于该提交方案的更多信息,我们建议直接阅读Tufa的完整分析。

有趣之处:

  • 这是唯一采用"智能体编写代码"方法的获奖提交,其他两个方案仅使用"选择JSON动作"。
  • 它是此前赢得ARC-AGI-3智能体预览竞赛的"Stochastic Goose"的精神续作。
  • 本地运行Qwen 3.6 27B FP8模型。
  • Tufa Labs指出,反直觉的是,手工工具实际上损害了模型表现;让模型自行发挥效果更好。
  • 被《Machine Learning Street Talk》专题报道。

[Tufa Labs团队在《Machine Learning Street Talk》上的专题报道](链接)

第二名 - Reki

一个视觉-语言模型,通过观察游戏棋盘图片,每一步返回一个JSON动作。

[Notebook](链接)

其核心是一个"视觉大语言模型作为策略"的智能体:每回合它将最近的帧渲染为带标签的图像,本地输入Gemma-4-31B模型,并请求一个描述变化情况、简要计划和接下来1-4个动作的JSON对象。它还会维护一个持续更新的反思记忆(每约10步刷新一次)。

此外,还提供了一种无需 GPU 的 numpy 点击启发式机制。硬编码规则使回退和探索性点击更倾向于选择小而颜色罕见、类似按钮的形状,而非随机像素。"Dead-signature" 机制会在点击某种对象时发现其从未产生任何变化,并停止在该关卡剩余部分对该对象进行无效点击。这些功能均可通过环境变量切换启用或禁用。

  • 基于官方 ARC Prize GPT-OSS-120B 模板构建。Reki 将模型替换为 Gemma-4-31B。
  • 设计为便于消融实验:可通过环境变量单独启用或禁用特定功能或技巧,使团队能够直接衡量每个修改的影响。
  • 包含 JSON 自修复功能、法律行动约束、1-4 步操作计划队列和反射内存。

第三名 - Md Boktiar Mahbub Murad, "forge" 框架

与 Reki(第二名)使用相同的"观察棋盘并返回 JSON 操作"智能体,但封装为可配置框架。

该提交方案与 Reki 的方案类似:将渲染帧转换为图像,发送给本地部署的 Gemma-4-31B 模型,保持反射内存,并返回带有修复和法律行动防护的结构化 JSON 操作。

区别在于该方案封装在名为 "forge" 的配置驱动框架中,通过参数控制流程。提交内容包含多个候选动作生成器、用于评分选择动作的仲裁器,以及可选的置信度提示(当模型不确定时强制执行安全可逆操作)。不过,该 notebook 的最高分运行使用了关闭所有附加功能的配置文件。

  • 基于官方 ARC Prize GPT-OSS-120B 模板构建。
  • 作者指出本地公开游戏检查并非可靠的排行榜代理指标。

祝贺所有三支获奖团队,感谢所有提交作品的参赛者。

第二(也是最终)阶段奖金将于9月30日截止。现在即可开始参赛。最快上手方式是复制其中一个模板或上方现有提交方案,进行个性化修改,尝试突破极限。

前往 ARC-AGI-3 Kaggle 竞赛页面即可开始参赛。