跨国串门儿计划播客1:30:10

#718. RSI:人工智能研究人员就当前范式能走多远展开辩论

8.5内容质量
#718. RSI:人工智能研究人员就当前范式能走多远展开辩论

播客收听

时长 1:30:10原播客页面

问这期播客

会先在本集摘要、章节、转录和笔记里找答案。

TL;DR · AI 摘要

AI研究者认为递归自我改进(RSI)的核心挑战是目标定义与泛化能力,而非单纯算力提升,自动化研究可能直接等同于人工通用智能(ASI)。

核心要点

  • RSI的瓶颈在于AI自主定义目标的能力,而非计算能力
  • sim-to-real迁移失败可能导致AI无法突破长时间跨度任务
  • AI研究自动化可能直接等同于人工通用智能(ASI)的实现

结构提纲

按章节快速跳转。

  1. 播客聚焦AI研究者对递归自我改进(RSI)范式的未来讨论

  2. 讨论焦点从AI能力提升转向目标定义与泛化能力的挑战

  3. sim-to-real迁移、持续学习与环境真实度构成关键障碍

  4. 强化学习依赖高质量起点,而非零基础创造能力

  5. AI研究自动化可能标志着人工通用智能(ASI)的临界点

  6. 人类可能长期保留目标定义工作,AI需突破认知闭环

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • RSI范式讨论
    • 核心挑战
      • 目标定义
      • 泛化能力
    • 技术瓶颈
      • sim-to-real迁移
      • 持续学习
    • 未来方向
      • 研究自动化
      • ASI临界点

金句 / Highlights

值得收藏与分享的关键句。

章节

  1. 2036年仍未起飞的原因

    2036年仍未起飞的原因

  2. AI研究最后的人类工作

    AI研究最后的人类工作

  3. 蒸馏如何对抗模型中心化

    蒸馏如何对抗模型中心化

  4. 自动化AI研究的训练路径

    自动化AI研究的训练路径

  5. 数据、环境与缩放瓶颈

    数据、环境与缩放瓶颈

  6. 强化学习为何有效又失真

    强化学习为何有效又失真

  7. 从远程员工到ASI的时间表

    从远程员工到ASI的时间表

转录

2036年仍未起飞的原因

AI研究最后的人类工作

蒸馏如何对抗模型中心化

自动化AI研究的训练路径

数据、环境与缩放瓶颈

强化学习为何有效又失真

从远程员工到ASI的时间表

#AI#强化学习#RSI#模型训练#自动化研究

节目笔记

#718. RSI:人工智能研究人员就当前范式能走多远展开辩论 - 跨国串门儿计划 | 小宇宙 - 听播客,上小宇宙

📝 本期播客简介

本期我们克隆了:Dwarkesh Podcast · AI researchers debate how close we are to recursive self-improvement

原内容更新时间:Fri, 11 Sep 2026

Dwarkesh Patel 邀请 Xyphra 的 CTO Beren Millidge、Thinking Machines 的首席科学家 John Schulman,以及 Base10 的模型训练负责人 Charlie O’Neill,讨论 AI 距离递归自我改进(RSI)还有多远。三位嘉宾都来自相对开放的 AI 实验室和公司,因此对强化学习、模型训练、部署数据与 AI 研究自动化展开了大量具体讨论。

本期的核心分歧,不是 AI 能否继续变强,而是它能否泛化到自己提出正确目标、设计有效实验,并在很长时间跨度内持续修正认知。嘉宾讨论了 sim-to-real(从仿真到真实世界的迁移)、持续学习、蒸馏、RLVR、数据瓶颈与强化学习的真实作用,也追问了为什么模型在基准测试中越来越强,却仍可能在现实世界的复杂任务上受限。

节目后半段进入未来预测:从能独立完成一个月白领工作的远程员工,到在所有电脑可完成的认知工作上压制人类顶尖专家,再到 AI 研究自动化是否等同于 ASI 完全。相比具体时间线,更值得关注的是三位研究者对“人类最后的工作是什么”以及“真正的智能爆炸会卡在哪里”的不同判断。

👤 本期嘉宾

Beren Millidge 是 Xyphra 的 CTO,所在团队正在开发开源模型。他重点讨论了强化学习为何比预期更有效、mid-training 如何为 RL 做准备、模型的熵坍塌与时间跨度泛化,以及持续学习面临的可塑性和灾难性遗忘问题。

John Schulman 是 Thinking Machines 的首席科学家,曾任 OpenAI 联合创始人,并带队开展 ChatGPT 背后的 RLHF(基于人类反馈的强化学习)研究。他从一线研究经验出发,解释了下一个 token 预测为何意外地成为有效目标,也讨论了 AI 研究自动化、目标定义与对齐之间的关系。

Charlie O’Neill 是 Base10 的模型训练负责人,参与讨论模型蒸馏、部署数据、在线学习、环境设计和强化学习训练。他尤其强调真实世界任务与刷榜分布之间的差异,以及模型要成为可靠远程员工,关键取决于在线学习和长时间跨度任务的解决速度。

⏱️ 时间戳

00:31 2036年仍未起飞的原因

07:01 AI研究最后的人类工作

16:18 蒸馏如何对抗模型中心化

24:55 自动化AI研究的训练路径

54:51 数据、环境与缩放瓶颈

1:11:22 强化学习为何有效又失真

1:21:32 从远程员工到ASI的时间表

🌟 精彩内容

💡 RSI 最大的难题可能不是能力,而是目标

AI 可以在明确目标上不断优化,但递归自我改进要求它自行提出目标、判断目标是否正确、设计实验并持续修正认知。真正的闭环不能只靠把已有环境做得更大。

"AI 到底能多好地泛化到自己摸索出目标?"

💡 sim-to-real 可能决定 AI 能否走出仿真

在数据中心里构建强化学习环境相对可控,但经营公司、打赢官司、与客户互动等任务包含复杂的非平稳分布。若模型无法从仿真迁移到真实世界,长时间跨度任务就可能成为递归自我改进的瓶颈。

"但另一种可能是,你确实需要通过这些真实的互动来进行权重更新,才能在这些事情上做得更好。"

💡 AI 研究自动化的最后一道门是定义问题

模型已经能帮助执行实验、写代码和分析结果,但研究的关键往往在于决定“该做什么实验”。人类可能会长期保留定义目标、判断品味和决定模型应如何表现的工作。

"我觉得人类的最后一份工作,或者说能留存最久的人类角色,就是定义目标,决定我们到底想要什么。"

💡 强化学习的成功,建立在一个足够好的起点上

RL 并不是从零创造全部能力。大量 mid-training 数据、合成推理轨迹和预训练,已经让模型接近最终能力;强化学习提供的是高信噪比的策略微调,因此少量信息也可能显著改变模型行为。

"它只需要从这些 episode 里拿到几个 bit,而这些你确实能拿到。"

💡 环境的真实度比难度更重要

容易验证的复杂任务可以带来刷榜,但不一定能训练出适用于现实工作的模型。要复制老师模型的真实能力,必须覆盖多轮人类交互、多重目标和不确定反馈,而不是只匹配容易评分的任务分布。

"你可以说这就是刷榜分布,因为很多最主流的基准测试其实就是做一些非常难、像解谜一样但容易验证的任务。"

💡 持续学习的瓶颈可能是技术,而不只是模型容量

把新能力蒸馏进另一个模型并不难,但在同一个模型上持续更新,容易出现灾难性遗忘、通用能力退化和知识注入困难。问题因此不只是模型够不够大,也在于现有训练方法会破坏什么。

"所以这很像是一个瓶颈阻碍了我们无休止地训练同一个模型,逼得我们只能从旧模型里提取所有数据,然后从零开始训练一个新模型。"

💡 第 37 手式的创造力不必然来自更高的输出多样性

RL 可能让模型的输出分布变窄,但这不等于它无法产生超越人类的解法。只要任务可搜索、奖励信号可靠,模型仍可能找到人类数据中没有出现过的策略;真正的问题在于环境是否足够多样,以及评审员是否被奖励黑客利用。

"而且我觉得很多情况,比如 RL 导致的熵坍塌,基本上是因为在环境缺乏多样性时,模型钻了那些相当简单的验证器的空子。"

💡 AI 研究自动化可能接近 ASI 完全

如果 AI 能在较长时间跨度内吸收实验结果、做出贝叶斯最优决策,并持续推进新的研究,那么自动化 AI 研究本身就可能意味着它已经跨过了最关键的能力门槛。嘉宾因此把 AI 研究员的自动化,与 ASI 完全联系在一起。

"所以基本上,你觉得实现 AI 研究的自动化,本身就相当于 ASI 完全,对吧?"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺