GPT-6 Astra, Looped Transformers, and Hidden Reasoning

TL;DR · AI 摘要
GPT-6 Astra在3D渲染和推理基准中表现卓越,循环变压器架构可能通过隐藏推理链提升模型能力,但技术细节仍需验证。
核心要点
- GPT-6 Astra在ARC-AGI-3基准中达到99.9%准确率(GPT-5.6仅7.8%)
- 循环变压器通过重复处理信息增强推理深度,但可能牺牲透明性
- OpenAI未公开Astra的隐藏推理链实现细节,引发技术验证需求
结构提纲
按章节快速跳转。
分析Astra在3D渲染、数学和编码任务中的基准表现及改进方向。
解释Looped Transformers如何通过重复处理增强推理深度。
探讨Astra可能隐藏推理过程对模型透明度和验证的影响。
- ·研究洞察
总结近期关于循环架构和推理链的学术研究发现。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- GPT-6 Astra技术分析
- 性能突破
- 3D渲染优化
- ARC-AGI-3 99.9%准确率
- 架构创新
- 循环变压器
- 隐藏推理链
- 研究争议
- 透明性问题
- 技术验证需求
金句 / Highlights
值得收藏与分享的关键句。
Astra在ARC-AGI-3基准中达到99.9%准确率,远超GPT-5.6的7.8%
循环变压器通过重复处理信息增强推理深度,但可能牺牲透明性
OpenAI未公开Astra的隐藏推理链实现细节,引发技术验证需求
GPT-6 Astra、循环变压器与隐藏推理
关于循环深度、隐藏推理链与近期循环变压器块研究的探讨
Sebastian Raschka 博士
2026年9月9日
过去几周发生了许多事情。我确信 OpenAI 的 GPT-6 Astra 目前是每个人关注的焦点。特别是关于其性能表现、循环变压器/循环深度特性,以及传闻称 Astra 隐藏了其推理轨迹(即推理链)的讨论。
在本文中,我将首先分享一些对 Astra 的初步印象,并探讨这些技术可能的发展方向。随后,我将详细讨论“循环变压器”具体指什么,以及它(或更准确地说,是否)与隐藏推理链之间的关联。
最后,在介绍完循环变压器的基础知识后,我想重点分享一些近期相关研究论文的新发现。
1. GPT-6 Astra 初体验
先说重点。在深入探讨架构传闻和相关研究文献之前,让我简要总结一些关于 GPT-6 Astra 的观察和发现。
上周,OpenAI 隆重发布了其新一代 GPT-6 Astra。过去几天我使用了该模型,它表现出色,可能是截至目前我使用过的最佳模型。但具体来说,它在哪些方面实现了改进?又通过何种方式实现的?
1.1 Astra 性能基准
Astra 是我目前使用过的最佳模型,尤其在3D渲染和动画任务中表现远超其他模型。这意味着,虽然它在几乎所有领域(写作、数学、编程等)都大幅超越了前代 GPT-5.6 版本,但其在图形演示任务中的表现尤为突出。
从基准测试数据也可以看出这一点。例如,如图1所示,GPT-6 Astra 在数学和编程任务中表现优异。
图1:三个主流编程基准和一个具有挑战性的数学基准测试结果。更多基准测试数据请参见 Astra 发布博客:https://openai.com/index/gpt-6-astra/
一个未在图中展示的亮点是,Astra 在 ARC-AGI-3 基准测试中达到了99.9%的准确率(GPT-5.6 仅为7.8%),该基准测试综合评估了逻辑谜题求解和泛化能力。不过,数学、编程和计算机使用相关基准测试更具现实意义,因为它们更贴近实际应用场景。
回到之前提到的人工分析编程代理指数 v1.4(上图右下角),该指数综合了多项代理编程任务,GPT-6 Astra 显然处于前沿水平,但并未实现压倒性领先。这一点也可以从下图展示的通用人工分析智能指数中看出,该指数综合了多种类型任务,而不仅仅是编程任务。
图2:人工分析智能指数(来源:https://artificialanalysis.ai/#intelligence)
人工分析基准测试的一大优势在于其独立性,因此相比模型开发者自评的基准测试,可能更具可信度。
测试环境的配置取决于具体基准。例如,GDPval-AA 和 AA-Briefcase 在比较不同大语言模型时,均使用开源的最小化 Stirrup 测试框架。在上图所示的智能指数 v4.2 中,Terminal-Bench v2.1 使用了 Terminus 2 测试框架,τ³-Banking 使用了 τ-Bench 测试框架。独立的编程代理指数也对比了不同的编程代理测试框架。
对于使用共享评估框架的模型,这使得比较更加具有可比性。同时,在模型训练过程中,模型通常会针对一个主要的评估框架进行开发(在其他框架上进行微调的次数较少)。此外,主要的评估框架往往是为了放大模型的优势而设计的。
因此,一些基于代理的评估可能会低估Astra在其主要评估框架中的表现。这种影响对智能指数评分的具体影响,需要通过在相同任务上跨不同框架比较Astra的表现来测试。
作为补充说明,正如一位同事最近建议我的(也如Claude Code负责人所推荐),也许可以考虑删除(或归档)一些现有的AGENTS.md内容和SKILL.md文件,因为新一代的LLM在理解提示和解决问题方面变得更加高效。过多的指导可能会不必要地限制新模型,导致更差的解决方案。
当然,我并不是建议永远不要使用SKILL.md文件,但在某些工作流程中,由于它们在重复使用时可以提高效率(模型无需重新发现这些内容),因此仍然有其价值。但我想强调的是,某些工作流程并不需要被描述,旧的描述可能已经不再理想,而LLM可能能够提出更好的解决方案。因此,或许现在是时候更新或重新生成这些指令文件了。
1.2 计算机使用能力
GPT-6 Astra在图像和渲染任务中表现得尤为出色。当这些任务涉及与图形用户界面交互时,它们还展示了计算机使用能力,这意味着模型可以通过Codex/ChatGPT应用在本地计算机上操作软件。
与其他模型相比,计算机使用能力是该模型真正的优势所在。任何与图形相关的内容在社交媒体平台上都能产生有趣且直观的演示效果。目前已有大量令人印象深刻的演示案例,例如在Blender中渲染纽约市模型,或虚拟看房之旅等。
以其中一个例子为例,下面的对比展示了GPT-6 Astra Medium和High版本如何通过我在电脑上的鼠标操作,在浏览器版的MS Paint中重新绘制我的画像(没有使用Extra High和Max版本,因为我不想浪费所有token :))。
这不仅突显了模型的艺术能力,更重要的是展示了其在用户计算机上使用工具的能力(在此案例中是Paint;你可以看到模型通过鼠标光标使用界面)。
这并不是第一个能够在评估框架内实现通用计算机使用的模型。例如,今年早些时候我就成功使用GPT模型完成了一些UI任务(如Excel中的报销相关任务)等。然而,计算机使用能力是一项相对较新的能力,依赖于评估框架的支持,通常感觉还不够成熟。这很合理。LLM是文本模型,因此自然更容易实现写作、编码以及使用API和CLI。
同时,有许多工具和软件尚未提供CLI(至少目前还没有),与其等待某人设计这样的界面,不如改进模型以使用图形用户界面(而且,正如之前提到的,这无论如何都能产生漂亮且令人印象深刻的演示效果)。这在某种程度上类似于人形机器人技术的发展。当然,人形机器人在装配线上并不是最高效的机器人,因为那里有专用机器。但它们具有多功能性。
因此,我预计未来几个月(甚至几年)也将是LLM和代理框架层计算机使用能力精炼的时代。也就是说,在现有能力基础上,除了进一步扩展数学和编程能力,模型将越来越多地针对计算机使用场景进行训练。这也将使LLM在科技圈外的日常计算机任务中更易于使用("嘿,ChatGPT,请帮我做税务申报" :))
1.3 计算机使用训练
计算机使用趋势也与近期OpenAI购买数以万计Mac Mini和Mac Studio用于强化学习的报道一致。在此场景中,这些Mac设备并非用于直接训练模型(使用GPU更适合),而是用于在模型训练过程中暴露macOS环境,使模型学习如何使用该操作系统及其工具。
那么这些Mac上的计算机使用训练是如何运作的?简而言之,Mac(或更准确地说,其macOS操作系统)作为训练过程中模型可以交互的环境。
基本工作流程如下:
- 通过给定任务(如"打开应用xyz并执行abc")向模型发出指令
- 由框架提供macOS界面的截图
- LLM随后预测鼠标/键盘操作(点击、按键、滚动等)
- 框架在Mac上执行这些操作
- 在执行完上一步操作后,提供更新后的环境截图
- 重复步骤2-5直到任务成功或失败
- 使用成功/失败信号和验证器(或评分器)作为训练反馈,包括后训练阶段的强化学习;这类似于带有可验证奖励的常规强化学习(RLVR)
图3:计算机使用训练工作流程概览
再次强调,Mac在此主要是作为环境存在,而非训练过程中运行或更新模型的机器。模型很可能部署在NVIDIA GPU上,并通过API与所述Mac进行通信。顺便提及,NVIDIA首席执行官提到GPT-6 Astra正在使用约10万台Grace Blackwell GPU进行训练。
1.4 GPT-6 Astra仍然是推理模型
上一节讨论的计算机使用训练重点并不是训练流程的根本范式转变。GPT-6 Astra(以及可预见的未来任何LLM)仍然是推理模型。这意味着LLM使用带有可验证奖励的强化学习(RLVR)进行训练,并生成中间推理轨迹(思维链)
不过,我将在本文后面部分详细讨论GPT-6 Astra的推理模型特性(特别是关于隐藏思维链的内容)。
2. 循环变压器
话虽如此,在官方模型发布前约两天,新闻杂志The Information发表了一篇文章,据内部消息透露,Astra正在使用一种称为"循环深度"或"循环变压器"的概念。
图4:The Information引述(来源:https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns )
由于LLM架构属于我的专业领域和热情所在,我制作了一段简短的视频讲座,解释通用的循环变压器机制并回应关于隐藏推理链的评论,您可以在下方找到该视频。
在以下小节中,我将首先解释什么是循环变压器,之后会在本文后面重新讨论关于隐藏思维链的评论。
(循环变压器的解释可能看起来有些冗长,但我认为这有助于建立对该技术的基础理解,而这种理解对于判断它是否掩盖了推理轨迹或思维链的主张非常有用。)
2.1 重复使用Transformer块
那么,什么是循环变压器?
循环变压器本质上是一种架构上的调整,其核心思想是将中间表示多次传递通过相同的Transformer块(而不仅仅是一次)。与简单地添加更多块相比,这里的“技巧”在于这些传递过程中的权重保持不变。
定义与术语
在本文中,我将使用以下术语:
- Transformer块是一个包含注意力机制、前馈模块、归一化和快捷连接的单元。这些块在论文中通常被称为“Transformer层”。
- 栈是Transformer块的序列。
- 块应用指的是将输入通过一个Transformer块运行一次。
循环变压器并非全新概念,其基本思想早在2018年的《Universal Transformers》论文中就已出现。但在讨论Universal Transformer之前,让我们先从一个更简单的例子开始:Nanbeige4.2-3B,这是一个于今年7月发布的近期开源大语言模型,我曾在Substack Notes和今年夏天的LLM架构画廊中介绍过它。
如图5所示,Nanbeige架构本质上看起来像一个常规的Transformer。但请注意,它有一个额外的(橙色)箭头循环回Transformer栈的起点。
图5. Nanbeige4.2-3B将相同的22个Transformer块栈应用了两次。橙色箭头显示了中间表示如何被重新传递回栈中。
让我们从底部向上逐步分析。首先,像其他基于Transformer的LLM一样,输入文本会被分词并转换为嵌入向量。这些向量随后通过22个Transformer块,每个块都有自己的权重。
然而,循环变压器的关键在于第一次传递后,隐藏状态会被重新输入到相同的22个块中。因此,块1再次被应用,接着是块2,依此类推,直到块22。
如果我们展开这个计算过程,总共会有44次Transformer块应用。但与拥有44个独立块的常规Transformer相比,第二次的22次块应用复用了第一次栈的权重。例如,第23次块应用使用块1的权重,第24次块应用使用块2的权重,依此类推。
图6. Nanbeige4.2-3B展开为两次通过相同的22个Transformer块,共产生44次块应用。
因此,这里的整体思路是:在不增加另一组Transformer权重的情况下,将有效深度从22次提升到44次块应用。
顺便问一下,为什么选择两次循环而不是三次、四次或更多?Nanbeige论文中没有太多细节,但作者表示这基本上是最高效的设置。将循环次数从2次增加到3次可以提升建模性能,但额外的计算成本并不值得。
因此,例如,一个使用22个transformer模块两次的模型,其(transformer模块)参数数量大约是使用44个常规模块模型的一半。
这会减少存储权重所需的内存。顺便提一下,注意嵌入层和输出层通常较大,占总参数的相当大一部分,这部分与当前比较无关。(以Nanbeige 4.2 3B为例,嵌入层和输出层约占总3B参数的25%;如果在这两个层之间共享权重,可以将这一比例降低到12.5%。)
图7:并排比较展示了传统方式与循环场景下所需参数数量的差异。
当然,在循环中重复使用相同模块仍然需要计算。更准确地说,在前向传播过程中,我们需要将中间输入通过44次模块应用传递。在训练过程中,梯度会通过共享堆栈的两次重复反向传播。因此,与仅使用22个模块一次相比,这会增加大量计算工作。实际上,其计算成本与使用44个独立模块相当(除了优化器需要更新的独立参数更少;反向传播仍然需要通过所有44次模块应用)。
还有KV缓存,它存储了前序token的注意力键和值,用于在常规和循环transformer的每个新token生成步骤中重复使用。顺便说一下,如果需要,我在这里有一篇关于KV缓存的独立文章:
从零开始理解并实现LLMs中的KV缓存
·
2025年6月17日
KV缓存是生产环境中高效推理LLMs最关键的技巧之一。KV缓存是生产环境中计算高效LLM推理的重要组成部分。本文将通过从零开始的、易于理解的实现,解释其概念和代码实现。
阅读完整故事
但回到主题。尽管循环transformer存在权重共享,但第二次通过模块时进入模块的中间状态是不同的。因此,在KV缓存中,这两个transformer堆栈产生的键和值也会不同(就像无循环的情况一样)。因此,KV缓存方面也没有节省。
为了更具体地说明这一点,例如,考虑循环transformer设置中使用模块1的第1次和第23次应用。但每次应用仍然需要自己的KV缓存条目。因此,由于必须为两次通过保留独立缓存,重复的22个模块堆栈的KV缓存需求与具有44个独立模块的常规transformer相同。
有趣的是,Nanbeige研究团队在论文中报告称,他们尝试在两次通过之间共享KV缓存。当然,这将KV缓存大小减半,但模型的表现不如使用独立缓存的版本(这也是他们发布的版本)。
在继续讨论其他循环transformer设计之前,先完成对Nanbeige的讨论。他们的技术报告还讨论了另外两个选择或权衡:
- 从头开始训练循环架构的效果优于通过upcycling方法将已预训练的transformer进行转换。
- 正如前一节提到的,两次通过提供了他们偏好的权衡。更多次通过只会带来微小的额外收益,同时会减慢训练速度并使优化过程变得不稳定。
因此,循环次数是另一个需要我们做出架构选择的参数。如前所述,在Nanbeige中,这一参数固定为两次。但接下来我们将看到,也可以根据token进行调整。
2.3 Universal Transformers与灵活的循环次数
现在,让我们回到Universal Transformers。在Nanbeige中,我们对22个transformer块组成的堆栈执行两次。在2018年的Universal Transformer论文中,作者选择重复应用同一个transformer块,而非重复堆栈结构。核心思想是相似的。
循环次数可以固定,但论文还探讨了自适应停止机制。例如,某个位置的token可能仅经历1-2次循环,而另一个token可能需要3-4次循环。这种设计使模型能够灵活地将计算资源分配给需要额外计算的token。
循环次数如何确定?模型使用一个小型训练函数,为每个位置在每一步生成所谓的停止概率。该函数将连续循环中的概率累加,当总和超过阈值时即停止该位置的循环。此外,最大循环次数限制也起到保险作用。
图8:Universal Transformer中的自适应停止。
另一个循环transformer的案例是字节跳动的Ouro,我在LLM Architecture Gallery中也对此做过介绍。例如,Ouro-Thinking 2.6B将48个transformer块组成的堆栈重复应用四次。这相当于存储48个不同块的权重,同时执行192次块操作。本质上,这比Nanbeige的极端程度更高。此外,一个学习到的退出门为不同退出路径分配概率,累积概率的阈值决定输出来自哪次循环。因此,它也借鉴了Universal Transformer的自适应停止思想(Nanbeige未采用)。(不过这里有个实际限制:Hugging Face发布的实现会先计算所有配置的循环,再选择输出,因此循环次数实际上被硬编码为4)。
2.4 灵活循环次数的路由机制
另一种方法是Mixture-of-Recursions,这是2025年的一篇论文,本质上是对前述Universal Transformer的更复杂版本。与Universal Transformer类似,如图所示,单个token会通过transformer块一次或多次。但创新点在于如何根据每个token确定循环次数。
在论文的下图中,循环(重复)堆栈在此被称为递归块。该块包含多个transformer块,位于独立的首尾transformer块(标记为Layer 0和Layer L-1)之间。
图9:Mixture-of-Recursions在不同token位置以不同次数应用共享堆栈。高亮文本展示了1、2或3次循环的示例。图改编自Mixture-of-Recursions论文。
模型如何决定token应通过递归块多少次?在之前讨论的Universal Transformer中,这是基于每一步的训练停止概率。而此处的Mixture-of-Recursion方法使用了一个小型训练路由器。这与专家混合模型中的路由思想类似,但此处的路由决策决定了共享堆栈的应用次数。
路由器基于标记的隐藏表示进行操作,而该表示中还包含有关上下文的信息。因此,我们不应认为每个特定标记的出现都会被分配相同数量的传递次数(例如,上图中的单词“People”并不总是经过3次循环)。该决策会根据该词出现的位置及其前文内容而变化。
现在,路由机制具体是如何运作的?论文探讨了两种实现路由决策的方式,如下图所示。
图10. 选择递归深度的两种方式。左侧示意图中,路由器在每一步选择继续处理的标记。右侧示意图中,单个路由器在初始阶段即分配传递次数。图表来自《递归混合》论文。
在专家选择路由(expert-choice routing)中(如上图左侧子图所示),每个递归步骤都会选择要处理的标记。退出的标记将不再参与后续步骤。在标记选择路由(token-choice routing)中(如上图右侧所示),路由器在初始阶段做出一次决策,将每个标记分配到具有1次、2次或3次传递的路径中。
在这两种方式中,Transformer的权重都会在多次传递中被复用,类似于Nanbeige等方法。但额外的灵活性来自于决定每个标记接收的计算量。模型和其路由器是联合训练的,因此模型在训练过程中会学习如何与这些不同路径协同工作。
2.5 这种方法的效果如何?
下图来自《递归混合》论文,比较了普通Transformer(Vanilla)、固定递归的Transformer(Recursive)以及递归混合(MoR)在不同模型规模和计算预算(x轴)下的表现。
图11. 四种模型规模和三种训练计算预算下的验证损失。图表来自《递归混合》论文。
在最小的模型规模下,普通Transformer表现最佳。对于更大的模型,递归混合方法逐渐赶上并经常表现更优,尤其是在较小的训练预算下。在最大的预算下,几条曲线非常接近。因此,优势取决于模型规模和训练时投入的计算量。
另一个需要注意的细节是,相等的训练计算量并不一定意味着相等的训练标记数量。通过跳过部分计算,递归混合方法可以在相同的预算下处理更多标记。
我认为这是一个有趣的例子,因为它表明在循环Transformer的概念中存在多种选择,即每个位置的循环次数以及如何决定这些次数。
简而言之,我们可以得出结论:如果模型足够大,在固定计算预算下使用循环Transformer可以提升模型质量。(这也说明了在大规模上运行实验的重要性;例如,如果我们只观察135M参数的小模型,就会得出相反的结论。)
3. 附注:循环神经网络(RNNs)
顺便说一下,如果你有深度学习(甚至1990年代人工神经网络)的背景,循环或“递归深度”的概念应该会有些熟悉。还记得循环神经网络(RNNs)吗?RNNs的核心思想是复用前一次迭代的层(权重)。
图12: RNN示意图(来自我2022年《使用PyTorch和Scikit-Learn进行机器学习》一书,https://amzn.to/3YzRnPR)
主要区别在于RNNs在时间步之间重复使用权重。也就是说,隐藏状态会从一个token传递到下一个token。在循环变压器中,token的循环是沿着架构深度进行的。
换句话说,在传统的RNN中,每一步都会读取输入序列中的下一个元素,并使用前一步的隐藏状态。因此,当RNN处理一段文本时,它一次读取一个词或token,并通过隐藏状态将前面词的信息传递下去。
在循环变压器中,给定token的中间表示会多次通过变压器堆栈。模型仍然使用注意力机制在token之间传递信息。
如果这个类比让你感到有些困惑,不必过于担心。或许更简单地理解循环变压器的方式是将其视为重复使用变压器块,类似于通过权重共享来扩大模型规模。
图13:RNN和循环变压器中“递归”的并排对比。
4. Astra甚至使用循环变压器吗?
在讨论循环变压器机制是否掩盖了推理痕迹(如《The Information》此前引用的传闻所述)之前,我们先要确认GPT-6 Astra是否真的使用了循环变压器的概念?
图14:来自《The Information》的引用(来源:https://www.theinformation.com/articles/secret-technique-behind-openais-astra-model-sparks-security-concerns)
我们必须记住,这仍然只是一个传闻或爆料,尚未得到官方确认。如果模型是开源权重的,我们当然可以自行验证,但在此情况下,我们只能依赖未经证实的报道。
不过,我认为GPT-6 Astra很可能使用了循环变压器的某些方面。首先,有上述提到的报道。其次,这是一种在以往研究中显示出潜力的技术(如前所述),所以为什么不采用呢?第三,OpenAI首席科学家曾表示:
[...] 我们当前前沿模型(包括Astra)的计算图深度与GPT-4的差距不超过两倍。 [...]
然而,这并没有明确确认循环变压器架构,也可能仅仅意味着他们使用了两倍数量的常规变压器块。
在我看来,Astra取得成功(即良好的建模性能)很可能主要归因于其他因素,即改进的训练方案和训练数据。
循环变压器的调整可能有所帮助,但我认为《The Information》对其贡献的估计有些过高。
5. 隐藏推理链条
接下来,让我们终于直面问题:循环变压器是否会掩盖推理痕迹?
首先,OpenAI从一开始就一直在隐藏(大部分)推理痕迹,至少从OpenAI o1开始就是如此。因此,对于终端用户来说,不应该存在太大差异。
因此,这种对解释的担忧主要针对模型开发者。
无论如何,我认为循环变压器并不是隐藏或模糊推理链条的重要因素。为了说明我的观点(并非有意使用双关语),让我们退一步解释推理模型的工作原理。
5.1 简要说明推理
推理模型通常在生成最终答案之前生成中间步骤。这些步骤使用常规文本token(在某些用户界面中可能对用户隐藏),并称为推理痕迹或思维链。
例如,假设我们寻找两个和为10且积为21的数字。在下图中,模型首先尝试5和5。虽然和是正确的,但乘积是25,而非21。随后,模型尝试3和7,并再次验证两个条件。
图15. 标注了中间步骤、回溯过程和最终答案的说明性LLM响应示例。
该图展示了推理模型如何进行推理,包括回溯过程。也就是说,模型会发现错误,然后重新审视之前的选项,并采用不同的方法继续推理。
请注意,模型仍然逐个生成令牌,使用提示和之前的令牌作为上下文。因此,这些中间步骤相当于草稿纸,在最终答案之前增加了计算过程。
最终答案可能比之前的推理轨迹短得多,如上例所示。(OpenAI倾向于向用户隐藏大部分推理轨迹。)
如需了解更多关于理解和开发推理模型的细节,我推荐我的书籍《Build a Reasoning Model From Scratch》。
图16:我的《Build a Reasoning Model From Scratch》书籍涵盖了推理模型的基础知识。
5.2 令牌使用与更短的思维链
现在,推理轨迹中的额外令牌会增加更多计算。循环转换器会增加更多计算,因为令牌需要经过更多的转换器块。有人可能会认为,使用循环的模型虽然内部计算更多,但不需要那么多外部思考令牌。
以下是GPT-6基准测试中的一部分,横轴为输出令牌数量。
图17:选自https://openai.com/index/gpt-6-astra/的GPT-6 Astra基准测试结果。
我们可以看到,GPT-6 Astra在整体努力水平上并不一定比其前身GPT 5.6 Sol使用的令牌更少。然而,在固定准确率下,确实GPT-6 Astra使用的令牌比GPT 5.6 Sol更少。
这对可解释性是问题吗?不一定。使用更少的令牌可能只是意味着模型能力更强,犯的错误更少,回溯更少等。也就是说,它可能第一次尝试就正确解决更多问题。对我来说,这并不会立即引发关于可解释性的担忧。
我的意思是,之前的模型也是如此。我不认为有人对GPT 5.6 Sol的可解释性比使用更多令牌完成相同任务表现的较小GPT 5.6 Luna模型差很多有强烈担忧,如下图所示。
图18:Luna和Sol在相似任务表现水平下的令牌使用情况。数据来源:Artificial Intelligence Index v4.3。
事实上,正如我们所见,Luna在相似建模性能下使用的令牌比Sol多出80%。这是否让Sol的可解释性差很多?
更合理的解释是,能力更强的模型(更大的、训练更好的模型,使用更多计算资源)可以更高效地解决问题,这里的“高效”意味着使用更少的令牌。
还需要记住的是,推理轨迹并不一定准确描述模型内部发生的一切。在我看来,唯一合理的担忧是循环转换器故意通过更频繁地呈现“虚假”推理轨迹来误导用户。但我不认为我们有任何确凿证据表明这种情况正在发生。
现在,Astra的系统卡确实指出,他们的推理轨迹监控能力也有所下降,并且与Sol相比存在一定程度的退化。这主要与较短且信息量较少的轨迹有关。但同样,这并不能证明循环是根本原因。这可能只是由于整体长度较短造成的,类似于上面Luna与Sol的案例。
在我分享了关于循环变压器如何隐藏推理链的观点几小时后,OpenAI首席科学家Jakub Pachocki也发表了以下澄清:
我想防止因混淆报道引发的对不可监控性的竞赛。目前我们前沿模型(包括Astra)的计算图深度与GPT-4的差距不超过两倍。OpenAI自首个推理模型以来一直致力于保持和利用思维链监控。我们非常重视这一技术,因为它能让我们观察模型对齐如何从训练分布泛化。我认为这一技术确实脆弱且不幸地呈负面趋势发展,原因与架构变化无关,我将在不久后详细说明。但我们可以采取措施加强它,这也是我们当前研究计划的核心目标。
“混淆报道”很可能指的是The Information此前提到的段落,暗示循环特性与思维链变化无关。
6. 循环变压器研究
最后,我想分享一些与我们之前讨论的循环变压器架构相关的有趣论文。
6.1 潜在推理
与通用变压器相关,2025年论文《通过潜在推理扩展推理时计算:一种递归深度方法》研究了模型如何在推理时使用额外的循环。为此,他们在800B个token上训练了一个相对适中但并非特别小的35亿参数模型。
与通用变压器重复使用相同模块不同,该模型采用类似Nanbeige的堆栈重复方式;但与Nanbeige不同的是,它在两个初始块和两个最终块之间夹着共享的四模块堆栈。
此外,与Nanbeige的不同之处在于,共享堆栈在每次循环开始时会接收初始块的输出,而不仅仅是前一次循环的隐藏状态。这些信息会被拼接并通过一个学习到的线性投影传递到四个共享模块中。可以将其理解为让堆栈在每次迭代中都能访问相同的初始输入表示。整个结构如图所示。
简而言之,这是一种额外且有趣的循环变压器变体。
图19. Geiping等人潜在推理模型的概念总结。
一个有趣的细节是,研究人员在训练过程中会调整循环次数。这使模型能够适应推理时不同计算量的需求。
在此过程中,训练时的循环次数是随机采样的。推理时,运行模型的人会选择固定预算,例如8、32或64次循环。此外,他们还为每个token设置了基于下一个token概率分布的自适应停止机制。如果两次连续迭代的KL散度低于某个阈值,即分布过于相似时,循环将被终止。
整体收益取决于具体任务。在他们的评估中,HellaSwag性能在大约八次循环后基本趋于稳定,而GSM8K和HumanEval则能从更多循环中获益。
然而,尽管论文标题提到了“潜在推理”,模型仍然可以生成文本形式的思考链。循环只是在每次输出标记前为其提供了额外的计算能力。
6.2 知识检索与推理
存储信息与使用信息解决问题之间存在一个有用的区分。例如,2025年6月发表的《Beyond Parameters: Exploring Virtual Logic Depth for Scaling Laws》论文通过分别测量大语言模型的记忆能力和推理能力来研究这一区别。
首先,在记忆实验中,当参数数量保持不变时,循环对存储信息量几乎没有影响。增加不同参数的数量确实会提升这种能力。由此我们可以得出结论:循环不会增加模型的知识存储或检索能力。这合乎逻辑。一旦信息被存储,信息检索就是一个相对简单的任务。此外,循环本身是一种计算机制,而非“存储”机制。
其次,在单独的推理实验中,重复使用模块块可以在不增加参数的情况下提升多步骤数学问题的性能。这很有趣。在这里,我们可以得出结论:即使模型没有更多存储信息的空间,额外的计算也能帮助其解决问题。但同样,更大的模型也可以提升推理能力(尽管它们也会增加参数数量)。
图20。在这项记忆测试中,容量随参数数量增加而增长,但额外模块块应用对容量影响很小。来自Zhu等人的注释图。
6.3 匹配计算预算下的循环
2026年9月最新发布的《SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers》论文重新回到第2.2节的成本比较。如果我们比较循环和传统Transformer在每标记计算量、总非嵌入参数和KV缓存需求大致相同时的表现会发生什么?
研究人员使用专家混合架构,并将Transformer模块块的中间部分应用两次,类似于Nanbeige,但采用了潜在推理中的夹层结构。
然而,他们缩小了隐藏维度以补偿额外模块块应用所需的计算量。然后,由于这使参数数量减少,他们通过增加专家来恢复总参数数量。他们还调整了注意力头配置以保持KV缓存的可比性。
图21。来自SMELT论文第3.2节的示例SMELT概述。
实验扩展到54B非嵌入参数等规模。然后,通过拟合的扩展曲线,研究人员估计SMELT在研究的计算范围内达到相同验证损失所需的训练计算量减少了约6.8-18%。
因此,这回答了循环Transformer在计算上是否值得的问题:是的!在相同的计算预算下,它们能提供稍优的模型。
6.4 全带宽Transformer
最后,2026年8月发表的《Full-bandwidth transformer》论文研究了跨标记位置的递归。在每个解码步骤中,它通过一个学习门将前一个标记的最终隐藏状态与新采样标记的嵌入进行结合。这将成为下一次前向传递的输入。
因此,下一个标记的计算可以访问堆栈底部前一个标记的最终表示,这在某种程度上类似于潜在推理。
当使用1B基础模型时,他们发现潜在反馈方法在MATH500上输出的推理轨迹更短,同时保持或提高准确性。然而,这种缩短效果在指令微调后消失。
图22. 潜在反馈使基础模型的推理轨迹缩短,但这种效果在指令微调后消失。改编自Wang等人,图6,CC BY 4.0。添加了定义和注意事项。
无论如何,这很有趣,因为它直接关联到之前关于循环是否导致更短推理轨迹的讨论。当然,结果取决于反馈机制和模型的训练方式。此外,该实验并未确定这些更短的轨迹是否不够忠实。
此外,该研究的一个重大注意事项是,他们没有测试通过传统方式(如增加更多Transformer块而非循环)扩大模型规模是否对推理轨迹长度产生类似影响。
结论
总结来说,我们可以确认,是的,OpenAI GPT-6 Astra是一个非常强大的模型。它在计算机使用方面实现了特别显著的飞跃。我认为在接下来的几个月里,计算机使用将成为开源和专有工具链下一个重要的关注领域。在计算机使用方面,我认为开源尤其重要,因为“权力越大,责任越大”,能够在将工具链接入我的主计算机之前对其进行审计是一件好事。
此外,GPT-6 Astra很可能使用循环Transformer的变体。循环Transformer在固定计算预算下能提供更好的建模性能。
此外,更优的建模性能可能在更短的推理链中有所下降。但这并不是新趋势。我们一直观察到,在不同规模模型(如GPT 5.6 Luna与Sol)的模型家族中,这种现象始终存在。
在我看来,更短的推理轨迹是更“智能”或能力更强模型的副作用,这些模型犯的错误更少,并且可以在其架构内部访问更多计算资源,而不是使用推理轨迹作为草稿纸。从某种意义上说,人类也是如此。在面对面的大学数学考试中,一个聪明且准备充分的学生可能需要更少使用草稿纸,并且需要回溯的次数更少,以此类推。
感谢阅读并支持我的工作!
如果你想学习如何自己构建推理模型,请查看我的书籍《从零开始构建推理模型》。我们从一个预训练的LLM开始,逐步添加推理能力,附带可运行和实验的代码。这既有趣又有回报,是对未来自己的良好投资,以构建基础能力跟上AI领域的发展。
此外,如果你读过我的任何一本书,我非常感激你能在Amazon上留下简短而诚实的书评。书评可以帮助其他读者判断一本书是否适合他们,也是支持作者的一种简单方式。
图23:我所著《从零开始构建推理模型》一书中的精选插图,涵盖推理时的扩展、蒸馏和强化学习。