跨国串门儿计划播客51:34

#683.Rich Sutton:大语言模型不是真正的智能,我们卡在了一个局部最优里

8.5内容质量
#683.Rich Sutton:大语言模型不是真正的智能,我们卡在了一个局部最优里

播客收听

时长 51:34原播客页面

问这期播客

会先在本集摘要、章节、转录和笔记里找答案。

TL;DR · AI 摘要

大语言模型缺乏持续学习能力,无法替代真实世界经验,AI发展受限于局部最优。

核心要点

  • 大语言模型部署后权重不再更新,缺乏持续学习能力
  • 合成数据无法替代真实经验,世界复杂性远超模拟
  • Oak Lab计划通过持续反向传播算法实现自洽智能体

结构提纲

按章节快速跳转。

  1. 介绍播客背景及Rich SuttonKhurram Javed的对话主题

  2. ·《苦涩的教训》与LLM局限

    揭示大语言模型作为《苦涩的教训》的反面例子,缺乏持续学习能力

  3. 论证合成数据无法替代真实世界经验,世界复杂性远超模拟

  4. 分析预训练模型停止学习的算法瓶颈及持续反向传播的解决方案

  5. ·Oak Lab的突破方向

    阐述Oak Lab打造自洽智能体的技术路径与五年发展愿景

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI发展瓶颈与突破
    • 大语言模型局限
      • 静态权重问题
      • 语言能力仅占智能20%
    • 合成数据困境
      • 无法替代真实经验
      • 模拟世界渺小
    • Oak Lab方案
      • 持续反向传播算法
      • 自洽智能体目标

金句 / Highlights

值得收藏与分享的关键句。

  • 互联网是有限的,而世界比互联网上的一切都要大得多得多

    第 11:14 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 大语言模型的权重永远不会变,它们声称能从完全不再学习的东西里榨出博士级经验

    第 23:23 段

    ⬇︎ 下载 PNG𝕏 分享到 X
  • 全部智能并不只是流畅的语言运用能力,语言大概只占智能的20%或四分之一

    第 44:25 段

    ⬇︎ 下载 PNG𝕏 分享到 X

章节

  1. 开场 & 播客简介

    开场 & 播客简介

  2. Rich Sutton 的开场宣言:持续学习才是正常思考方式

    Rich Sutton 的开场宣言:持续学习才是正常思考方式

  3. 主持人介绍 Rich Sutton 与 Khurram Javed

    主持人介绍 Rich Sutton 与 Khurram Javed

  4. 为什么在 AI 寒冬押注强化学习

    为什么在 AI 寒冬押注强化学习

  5. 2003 年与癌症搏斗的经历

    2003 年与癌症搏斗的经历

  6. 2019 年写下《苦涩的教训》的契机

    2019 年写下《苦涩的教训》的契机

  7. 苦涩的教训的本质:别被人类知识带偏

    苦涩的教训的本质:别被人类知识带偏

  8. 大语言模型是正面还是反面例子?

    大语言模型是正面还是反面例子?

  9. 合成数据是"大错误":大世界假说

    合成数据是"大错误":大世界假说

  10. 大世界假说:世界比互联网大得多

    大世界假说:世界比互联网大得多

  11. 谁来判定合成数据的好坏?

    谁来判定合成数据的好坏?

  12. 世界无限复杂,任何模拟都渺小得可怜

    世界无限复杂,任何模拟都渺小得可怜

转录

开场 & 播客简介

Rich Sutton 的开场宣言持续学习才是正常思考方式

主持人介绍 Rich Sutton 与 Khurram Javed

为什么在 AI 寒冬押注强化学习

2003 年与癌症搏斗的经历

2019 年写下《苦涩的教训》的契机

苦涩的教训的本质别被人类知识带偏

大语言模型是正面还是反面例子?

合成数据是"大错误"大世界假说

大世界假说世界比互联网大得多

谁来判定合成数据的好坏?

世界无限复杂,任何模拟都渺小得可怜

自动驾驶模拟器人类在循环里的瓶颈

大语言模型不是经验型学习者

预训练与后训练之后,模型就不再学习了

持续深度学习是算法缺口

解药步长优化与持续反向传播

从空谈到行动创办 Oak Lab

最有野心的目标拥有完整跨度的知识

"这是触手可及的"五到十年的判断

如果一切顺利,Oak Lab 会变成什么样?

#强化学习#大语言模型#持续学习#AI局限性

节目笔记

#683.Rich Sutton:大语言模型不是真正的智能,我们卡在了一个局部最优里 - 跨国串门儿计划 | 小宇宙 - 听播客,上小宇宙

📝 本期播客简介

本期我们克隆了:知名播客 Training Data Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again。原内容更新时间:2026-08-18。嘉宾 Rich Sutton 与 Khurram Javed 讨论持续学习、合成数据、大世界假设、灾难性遗忘和能持续学习的智能体;由 Sequoia Capital 的 Sonya Huang 与 Alfred Lin 主持。

原内容更新时间:2026-08-18

本期嘉宾是强化学习领域的奠基人 Rich Sutton,以及他的联合创始人、前学生 Khurram Javed。主持人是红杉资本的 Sonya Huang 与 Alfred Lin。Rich Sutton 是那篇经典文章《苦涩的教训》的作者,也是阿尔伯塔大学强化学习研究的核心人物。这期对话围绕持续学习、合成数据的局限,以及他们创办的 Oak Lab 想要实现的新一代智能体展开。

这场对话从《苦涩的教训》出发,直指当前 AI 领域的核心矛盾:大语言模型在部署后权重不再更新,本质上不是持续学习者。Rich 与 Khurram 提出了"大世界假说",认为世界远比互联网上的一切都要大得多,合成数据无法替代真实经验。他们还分享了 Oak Lab 的野心——打造一个能持续学习、形成抽象、并保持自洽的智能体,并给出了具体的技术路径,包括持续反向传播算法和步长优化。如果你关心 AI 的下一个范式是什么,这期节目会给你一个完全不同的视角。

👨‍⚕️ 本期嘉宾

Rich Sutton,强化学习领域的奠基人之一,阿尔伯塔大学教授,著有奠基性教科书《Reinforcement Learning: An Introduction》,培养了大批该领域的关键学生(如 AlphaGo 的 David Silver)。他的文章《苦涩的教训》被视为深度学习领域的"圣经"。Khurram Javed 是 Rich 在阿尔伯塔大学的学生,也是 Oak Lab 的联合创始人,专注于持续学习与"大世界假说"的研究。

⏱️ 时间戳

00:00 开场 & 播客简介

"我不怪,这个领域才怪"

01:15 Rich Sutton 的开场宣言:持续学习才是正常思考方式

01:57 主持人介绍 Rich Sutton 与 Khurram Javed

02:53 为什么在 AI 寒冬押注强化学习

03:40 2003 年与癌症搏斗的经历

《苦涩的教训》与大语言模型的局限

07:45 2019 年写下《苦涩的教训》的契机

09:03 苦涩的教训的本质:别被人类知识带偏

10:13 大语言模型是正面还是反面例子?

11:14 合成数据是"大错误":大世界假说

为什么合成数据无法替代真实经验

11:42 大世界假说:世界比互联网大得多

12:18 谁来判定合成数据的好坏?

14:18 世界无限复杂,任何模拟都渺小得可怜

16:10 自动驾驶模拟器:人类在循环里的瓶颈

持续学习:算法缺口与解药

22:33 大语言模型不是经验型学习者

23:23 预训练与后训练之后,模型就不再学习了

37:58 持续深度学习是算法缺口

39:10 解药:步长优化与持续反向传播

Oak Lab 的野心与未来

35:44 从空谈到行动:创办 Oak Lab

42:34 最有野心的目标:拥有完整跨度的知识

44:25 "这是触手可及的":五到十年的判断

47:53 如果一切顺利,Oak Lab 会变成什么样?

🌟 精彩内容

💡 "我不怪,这个领域才怪"

Rich Sutton 反复强调自己并不激进,他只是在用"普通的方式思考"。在他看来,所有学习都是持续的,我们一直在行动、一直在学习,这才是正常的思考方式。是 AI 领域把"持续学习"当成了一个特殊概念,才显得他奇怪。

"所有学习都是持续的。我们一直在行动,一直在学习。这才是正常的思考方式。"

💡 大语言模型既是《苦涩的教训》的正面例子,也是反面例子

正面在于它把计算规模的扩展做到了极致,直接吞下整个互联网;反面在于它最终会被人类知识限制住——互联网是有限的,而世界比互联网上的一切都要大得多得多。

"互联网是有限的,很难再拿到更多样本。而世界很大,世界比我们存在互联网上的一切都要大得多得多。"

💡 合成数据是"大错误"

Rich 与 Khurram 直言,合成数据生成是当前扩展范式的根本问题。谁来判定什么样的合成数据是好的?这需要人类专家,而这就是瓶颈所在。更根本的是,世界无限复杂,任何对它的模拟都渺小得可怜。

"世界是无限复杂的,任何对它的模拟都渺小得可怜。"

💡 大语言模型的权重永远不会变

这是 Rich 对当前主流范式最尖锐的批评:模型在部署后就不再学习了。你可以给它更多上下文,但模型本身已经停止学习。相比之下,Cursor 和 Tab 这类产品因为持续更新权重,反而是真正的持续学习例子。

"它们的权重永远不会变。……他们声称能从一种完全不再学习的东西里,榨出博士级的经验和专业能力。"

💡 学校其实无关紧要

Rich 认为,没有哪种动物是通过监督学习来学习的。松鼠不上学也能学会那些东西,学校是非常特殊的东西,就连人类也是直到几百年前才有的。把监督学习当成学习的主要例子,是一种干扰。

"你看,松鼠不上学,也能学会那些东西。动物不是那样学习的。"

💡 我们卡在了一个局部最优里

Khurram 认为,当前的大实验室被产品绑得太死,无法去走一条"事情会先变差"的路。新范式在变好之前几乎不可避免地会先变差,而那些大实验室不可能接受这一点。

"当我们开始探索这些新方向时,你不可能第一天就拿到最先进的性能。但这是因为,它是一个不同的范式。"

💡 大语言模型大概只占智能的 20%

Rich 明确表示,大语言模型是了不起的科学突破,但它被过度包装成了"全部 AI"。全部智能并不只是流畅的语言运用能力,语言只是重要的一部分,还有太多别的东西没做完。

"全部智能并不只是流畅的语言运用能力。还有太多别的东西。语言是重要的一部分。它大概占智能的 20% 或者四分之一。"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺;

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight