Interconnects AI

I wrote an AI textbook — how long until AI can do it better?

8.5内容质量

TL;DR · AI 摘要

AI在非虚构写作和复杂科学问题上仍需人类引导,当前模型在组织知识和解决开放性问题上存在局限。

核心要点

  • 当前LLM在非虚构写作中难以有效组织知识,影响科学问题解决。
  • AI在数学等领域的进步有限,需依赖人类进行知识压缩和引导。
  • Anthropic的进展显示AI在特定科学问题上有潜力,但整体仍需改进。

结构提纲

按章节快速跳转。

  1. 指出AI写作能力的争议焦点在创意写作而非非虚构领域。

  2. 分析LLM在组织知识和呈现科学内容时的局限性。

  3. 强调模型需先掌握知识压缩能力才能解决开放性科学问题。

  4. 引用Anthropic黎曼假设上的案例说明AI的潜力与不足。

  5. 提出人类需作为知识压缩的引导者与AI协作。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • AI写作能力与局限
    • 非虚构写作挑战
      • 知识组织缺陷
      • 科学内容呈现不足
    • 人类协作必要性
      • 知识压缩引导
      • 开放性问题解决
    • 科学进展案例
      • Anthropic黎曼假设研究

金句 / Highlights

值得收藏与分享的关键句。

#AI#LLM#科学写作#自然语言处理
打开原文

我写了一本AI教材——AI何时能做得更好?

关于AI写作能力的反思及AI模型如何变得更强大

Nathan Lambert

2026年8月12日

文章配音

0:00

-12:32

您的浏览器不支持音频播放。请升级浏览器。

对AI写作有很多批评,但大多数批评集中在更具创意、高水准的写作上,比如这篇博客。这些批评(包括我自己的观点)通常认为,这是因为优秀的写作需要高水准的表达、明确的观点、深刻的个人情感传达,或是通过选词让读者窥见思考过程。随着大型语言模型(LLMs)作为工具变得更完善,而非仅仅作为对话助手,我认为我们在实现模型产出鼓舞人心的写作这一目标上,实际上正在倒退。

另一方面是非虚构写作。填充文本、复制文本曾是LLM真正有用的技能之一(Sam Altman在最近的一次播客中曾多次谈到GPT-3早期业务的这一特点)。这里的问题似乎主要源于模型整体智能的不足,或某些训练问题,而所有非虚构和解释性文本最终都会被快速的技术进步所超越。过去几年作为写作助手使用这些模型,它们确实有所改进,但值得反思的是什么因素阻碍了它们的进步。

对于依赖模型在未来短期内自主解决重大开放科学问题的人来说,模型在长篇非虚构写作上的停滞应引起警觉。如今的模型在组织和有力呈现其领域内最基础的科学知识方面仍存在困难。这似乎是我们期望模型在能够独立解决广泛开放性问题之前必须掌握的自然前提。在解决这一问题之前,LLM在科学领域的进展将更接近于解决低垂果实和跨学科的遥远关联,而非任何革命性的洞察。

对于一个对AI进步非常乐观的人来说,这是一个颇具争议的观点,尤其是在Anthropic发布一篇关于Claude在著名黎曼假设上取得进展的博客文章当天提出这一观点。科学问题具有广泛的广度,我认为当前AI模型的覆盖范围并没有许多人想象的那么大。

知识整理是一种压缩。这种压缩是产生洞察力所必需的。如今的LLMs在长篇非虚构写作中增加了熵,我看不到这种熵可以无限叠加。它们将依赖人类作为某种向导。

我仍然对从这些狭窄的科学形式(如我们在数学领域看到的极端进步)向更一致、更广泛的进展进行翻译持乐观态度——LLMs是科学家们使用过的最强大的助手。我需要先解释一下,观察模型在写作中处理这种基础、低层次知识问题的方式,让我看到了令人惊讶的泛化能力不足。

更多背景信息:我刚刚完成了一本后训练教材的写作,《基于人类反馈的强化学习》(在Manning或Amazon购买)。我在许多方面使用了LLMs来支持这项工作,从帮助整理方程的LaTeX格式,进行大量校对,以及为编程语言(如TikZ(LaTeX)或Python)创建图表。

为什么模型在写作质量上停滞不前?

我原本预计模型在非虚构写作方面会有更大的进展。2024年的情况让我一度以为,如果在2026年出版非虚构书籍,可能会显得有些愚蠢。如今,一些最著名的写作能力模型仍停留在较旧的版本,例如OpenAI的GPT 4.5和Moonshot的Kimi K2。在这些模型发布期间,它们在编程和数学等其他任务上的表现已从普通提升到超越人类水平。更接近的类比是,模型在搜索和研究任务上的表现从完全无法胜任提升到了令人满意的程度。大多数其他技能的进步速度都很陡峭,但写作能力似乎与这些技能存在某种正交关系。我认为写作并未被忽视,而是具有挑战性且缺乏高质量的训练数据来专门优化。

确实存在一些显而易见的改进点,可以让AI模型在写作方面表现更好,例如Claude Code等专用工具、提示工程以及训练环境,这些都能让模型在输出时消耗更多推理token。但我认为这些方法对能力的提升不会产生乘数效应。写好文章是一项非常困难的任务!令人遗憾的是,我们尚未在这一重要的智力追求领域实现推理时的扩展。无论如何,写作似乎与模型擅长的领域存在显著差异。1

如今,模型在长篇技术写作方面表现得确实糟糕。它们可以写出正确的句子,但如果你要求它们撰写整章内容,结果往往充斥着令人困惑的措辞、组织混乱,整体上略显偏离主题。它们在不需要的地方过度追求俏皮,反而在过程中产生随机的概念性错误。未来近期内,模型在小错误上的表现会显著改善,尤其是随着模型规模扩大——这使它们能够容纳更多世界知识——但我并不期待它们利用这些知识的能力会有质的飞跃。

例如,GPT模型长期以来在查找拼写错误和小问题方面表现出色。我将书的几乎最终稿以PDF形式发送给GPT 5.5 Pro,它在整个200-300页的文稿中发现了许多深刻且令人意外的细微拼写错误。

另一方面,Claude模型作为编辑工具则更为实用。它们拥有更敏锐的审美,通常能更好地理解任务的心理模型,并能提出更有创意的建议来解决各种写作障碍。

我上面提到的例子都呈现出某种一致的主题:模型能够检查每个内容单元(通常是句子、公式或图表),或在特定部分发现你可能遗漏的问题。凭借这些能力,它们在重新审视组件并将其串联起来时表现不佳,因为它们在叠加多个修改时容易产生累积性错误。这感觉就像某种不可简化的错误叠加。我们过去在数学和代码中处理这些错误,但回想起来,RLVR确实是一个真正神奇的解决方案,能够显著减少这类错误。

Interconnects AI是一份由读者支持的出版物。请考虑成为订阅者。

作为作者如何从当前模型中获取价值

我愿意分享一个事实:在我的书中,有少数几处技术解释句子是来自AI模型生成的——比例不到1%。这些句子之所以被保留,是因为我真心喜爱它们。我允许自己在书中包含一些AI生成的内容,因为当我作为真正的专家,确信某句话对读者是必要的,这种做法并不算作弊。尤其是在编辑过程中,当我对细节保持高度关注,又担心自己是否能完成所有工作时,这种借助AI的方式成为了一条极其有价值的前进路径。

例如,我的编辑在LaTeX文件中用特定分隔符(如\editor{})插入了一连串问题。我会让Claude Code定位到每条注释,打印出前后上下文,并告诉我这是否是简单的拼写错误,还是需要更深入处理的内容。我会撰写回应——即要插入的文本——或在修正前请Claude提供修改建议。从智力角度来看,这种编辑过程非常专注,但这也成为提升书籍质量的一种有趣方式。有时,书中最终采用的某些短语正是来自Claude的建议。

这无疑是一条危险的斜坡。当我接受了一些AI建议时,正处于完成第二轮完整手稿审阅的阶段。情感上,这个项目似乎已经完成,但我仍有大量工作要做。在完成教科书写作后,我非常感激自己为Interconnects写作设定的明确规则:绝不使用AI生成内容。以个人风格写作——那种充满激情、被高度珍视的表达方式——确实更有趣,但撰写标准参考文献并不是以乐趣为导向的活动。我理解为什么当人们大部分写作只是为了填充空间而非达成目标时,会将AI工具当作拐杖。我渴望通过大量写作来学习、感受并表达。

在科学工作中,我也在经历类似的平衡。AI模型非常适合处理论文中重复性的部分,比如撰写你早已熟悉的综述或背景章节,但将它们用于摘要、引言、实验或结论部分则是一种浪费。这些部分承载着研究故事和灵魂——正是在这里,你才能真正理解自己的研究核心。

我确信,通过让AI模型协助我完成非虚构写作的创作和校对,我创造了更多净价值。它们让撰写公式变得轻而易举,能帮助重构代码库、在语言间移植代码,还能完成许多其他任务。起初,这种体验非常有趣,直到我被出版流程的漫长耗尽精力,看着领域不断向前发展。

以一个具体例子说明AI在此过程中的关键作用:我需要同时在两个位置维护书籍的Markdown和LaTeX版本,因为读者会针对网页版提供反馈,而Manning编辑团队则审查一个分支版本。如果没有AI代理,同步这两个版本将耗费我五倍的时间(这项任务本身已经耗时数十小时)。

与这个故事交织在一起的是我在思考代理系统时偶然发现的一个问题:使用代理并不会提升你的理解速度。这种理解,以直觉、品味、本能等形式存在,才是未来真正有价值的东西。将AI用于非虚构写作会阻碍这种能力的提升。更糟糕的是,如果你本身不是专家,你将无法发现AI生成内容中的缺陷。

在某些情况下,我迫切地想要将脑海中的知识倾注到纸面上,以至于使用AI模型成为了一种有价值的工具。我写这本书的动机之一,是为像拒绝采样或字符训练这类重要的后训练方法提供一个统一的参考资料,而网络上关于这些内容的资料非常有限。

这本教科书的创作过程本质上是对社区的回馈,因此以任何形式完成它都让我感到非常满足。我确信如果投入更多人力,我能够学到更多,作品也可能会略有提升。但决定性因素是我担心在出版时这本书会过时,一方面是对AI模型能力的担忧,另一方面则是这个领域发展速度之快。

事实证明,我的这种担忧是错误的。我对最终成果非常满意,而且现在比2024年刚开始写作时更有信心这本书能长期留存,因为这些模型在非虚构写作领域远未达到宣传中的水平。

技术写作的未来方向

这些模型是惊人的工具,它们能够以多种形式表达知识。它们非常适合生成创意填充内容或背景材料——例如幻灯片的初稿,其真正价值是作为教师授课时的讨论焦点——从而让知识在不同媒介间转换。

撰写非虚构类或参考类教科书的早期阶段,存在一些微妙的写作过程,这种感觉与撰写类似本文的高声调博客文章有些相似。在推进早期结构设计和核心框架呈现的过程中,新的知识会被创造出来。这个阶段需要洞察力,而当前的大型语言模型在替代人类完成这部分工作方面还远远不足。

上述段落和前文的核心观点是:如果世界上更多专家能使用AI模型撰写书籍中的一小部分内容,我将非常欣慰,因为这能让更多知识传播到世界。问题是目前AI模型只能节省10%-20%的工作量,而我看不到这个比例短期内会成为主流。

还有社会压力因素,人们期待LLM成为最优秀的个性化教育者,因此认为撰写书籍或教育内容毫无意义。我认为部分观点正在改变,因为最高质量的教育内容始终存在巨大缺口。AI擅长将已有内容转化为适合学生的形式,但无法从零开始创造内容。

目前我感觉我们陷入了一个令人沮丧的局部最小值:AI模型总体上会减少非虚构写作的平均工作量,但它们也能实现卓越的表达。这会导致更少的人愿意开始并坚持完成创作。

因此,在2-5年后,我仍然预计最好的教科书仍会由人类精心打造。我不确定之后会怎样,但这个时间跨度比许多人预期的要长得多,毕竟这些模型掌握的知识量如此庞大,且具有持续输出知识的结构性倾向。

关于能力的结论,模型在两个场景中表现突出:1)任何真正可验证的领域,以及2)在提供大量上下文并进行小幅修改时(例如发现错误、解决特定数学问题或提供建议),而非开放式生成长篇大论。长篇写作的表现肯定不如创意写作,但这也明确表明,当问题描述不清晰时,模型无法充分展现其知识广度。当我们试图让模型成为“数据中心里的天才”,解决重大科学问题时,这种局限性似乎是一个根本性障碍。

Jasmine Sun 撰写了一篇精彩文章,解释了为什么大语言模型(LLMs)既适合担任编辑,又不擅长写作。

部分原因在于人们使用模型的方式。如果你在 Claude Code(或聊天应用,我相信也一样)中向 Claude Fable 5 提问:“为我写一首关于金鱼的优秀诗歌”,模型会迅速生成答案。我询问模型是如何做到这一点的,以及它是否像人类一样先在草稿纸上构思并迭代修改后再输出结果,模型的回答是否定的。它在推理过程中制定了一个最小计划,然后通过自回归生成诗歌。这种方法完全没有利用推理时的扩展能力,也没有将其视为一项复杂任务。

这大概就是大多数人使用模型进行写作的方式,因此结果平庸也就不足为奇了。要获得最佳效果,需要对模型进行密集提示,让它在回答前进行大量思考,并参考其他评估模型的意见后再输出文本。考虑到模型目前确实具备一些真实能力,有一种简单的方法可以提升长篇内容的质量。

上一页 下一页