5 useful things you'll learn in my new post-training textbook (shipping now!)

TL;DR · AI 摘要
本书系统讲解LLM后训练关键技术,包含拒绝采样等方法,适合有CS基础的工程师深入学习。
核心要点
- 书中包含拒绝采样、结果奖励模型等后训练核心方法
- 提供12小时课程及代码库,含模型完成度对比
- 目标读者为已完成计算机科学本科学习者
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- LLM后训练教材
- 核心方法
- 拒绝采样
- 结果奖励模型
- 字符训练
- 配套资源
- 12小时课程
- 代码库
- 模型对比
- 目标读者
- CS本科毕业生
金句 / Highlights
值得收藏与分享的关键句。
书中讨论的拒绝采样和结果奖励模型是当前LLM后训练领域的重要方法
目标读者需要已完成计算机科学本科学习,适合进阶工程师
新增的on-policy distillation章节反映了领域最新实践
我的新版训练后教材中你将学到的5个实用内容(现已发布!)
我的新版训练后教材中你将学到的5个实用内容(现已发布!)
人类反馈强化学习即将登陆你的Neolab
2026年8月10日
##### 常规事务:这次不会对另一个快速“发布”文章进行配音。更多文章即将推出!
在经历了数年寻找时间记录开放模型训练经验的艰难过程后,我的训练后教材终于完成了!这本书由Manning出版社出版,书名为《基于人类反馈的强化学习:对齐与训练后大语言模型》。
讲述这本书的故事是解释你为何需要一本的原因。
这本书最初是一个网站,我想要记录那些可能没有在线资料解释的关键训练后方法。如果存在相关资料,我也找不到。考虑到训练后方法在2024年(我购买域名时)就已流行,并且至今仍然持续,这种现象涉及的主题比你想象的要多得多。拒绝采样、结果奖励模型和字符训练等主题就是典型例子。这使得网站变得相当受欢迎,因为它仍然是少数几个以基础且直观方式讨论这些主题的地方之一。
除此之外,书中大部分内容是关于传达直觉和历史的。LLM行业很大一部分由过去几年变化不大的核心技术定义。这本书是我尝试用简单语言解释训练后方法为何有效、人们需要做出哪些权衡才能正确实施它,以及人们经常陷入的误解。为此,一些Interconnects上较早的基础博客文章被重新整理,以串联起关键数学主题背后的故事。因此,很多解释性文字可能比普通教科书的语气更高。
这就是几年前我刚开始学习时想读的书!事实上,由于仍有大量人向我询问基础的训练后问题,而且这个群体正在加速扩大,我预计这本书会受到广泛欢迎。我仍然定期使用这本书,也经常收到业内资深研究人员的反馈称他们同样如此。因此,这不是一本入门书籍——它更适合作为已经完成计算机科学本科学位的人的进阶读物——但如果你掌握了它,你将在训练后的世界观上遥遥领先。
给读者的专属优惠!
这本书在线上也可以免费获取,并附带完整的12小时课程(含YouTube上的幻灯片和视频)、一个带有建议练习的简单代码库,以及模型完成度对比。在Manning上使用代码PBLambert,直到8月19日均可享受50%的折扣。
从Manning购买我的书
从Amazon购买我的书
是的,这本书的标题略显过时——我在出版过程中学到了一些经验,也经历了一些斗争——但我可以保证内容非常新颖。我经常在研究工作中参考这本书,也收到朋友的反馈称他们同样如此。我在最后一刻添加了关于策略梯度蒸馏的章节!这本书现已由Manning和Amazon US发货,Amazon UK将在10月发货。
1. 关于RL算法如何改变模型输出的直觉
通过字数或页数计算,这本书大约有25%的内容涉及强化学习(RL)。这个比例是合理的。如果这本书要传达一个核心信息,那就是教会读者如何思考各种RL算法。从策略梯度定理到PPO,再到现代版本如GSPO和CISPO,这些直觉对于判断一个新算法是无效还是具有潜力至关重要(任何新算法都不可能在一开始就立即被证明正确)。
以下是一个在阅读后你应该能够理解的直觉示例。
例如,这里有一个我们为理解PPO裁剪机制而反复迭代的有趣示意图。最终,PPO的替代目标可以简化为六个区域。这些区域可以被看作两个梯度,当某个token的优势值为正或负时,梯度会根据策略比率的当前值变化。在一个完成样本中,它会出现在这个图表的某个位置。如果它是批次中的第一个梯度步骤,它会从x轴的1点开始(梯度始终流动),然后根据更新RL策略行为后的比率变化,梯度保持不变或变为0(这就是裁剪参数的作用)。
这种直觉紧密地融入了系统设计中,以管理梯度和它们通常引发的数值问题。专注于数学的策略梯度部分非常详尽,涵盖了过去三年中你可能听说过的所有算法:
- 策略梯度推导
- 基础策略梯度
- REINFORCE
- REINFORCE留一法(RLOO)
- 近端策略优化(PPO)
- 理解PPO目标函数
- 价值函数与PPO
- 分组相对策略优化(GRPO)
- 分组序列策略优化(GSPO)
- 截断重要性采样策略优化(CISPO)
- 算法对比
2. 对新RL系统和算法所面临关键因素的理解
现代RL的大部分内容都是一个系统问题,需要在几个方面取得平衡——数据的离策略程度、训练与推理的不匹配,以及吞吐量。核心系统设计——使用独立GPU进行学习者(执行梯度步骤的GPU)和执行者(在环境中生成rollout的GPU)的异步RL——已经持续几年保持相似。
智能体任务仅在这些基础之上增加了更多基础设施。这本书被设计为从几乎零LLM RL知识开始,成为最简单的入门资源,使读者能够准备对系统进行实验。它从基础开始,例如解释实现RL算法的一般形式:
pg_loss = -advantages * ratio
接着继续教授你关于损失聚合的知识——这一思想催生了DAPO和Dr. GRPO等早期GRPO变体——以及截断重要性采样——这一技术用于使PPO在早期RL实验中发挥作用。
- 策略梯度基础
- 损失聚合权衡
- 异步RL系统
- 截断重要性采样
- 示例:PPO
- 示例:GRPO
3. 引发现代后训练的历史
了解一个领域是如何形成的一直让我着迷。当你成为专家后,比任何人都更深入了解该领域的历史,这将帮助你做出最佳预测(Bill Gurley 在他最近的书中也给出了类似的建议)。在深度学习基础(如Transformer)被构建的时期,现代训练后阶段的核心也在对齐领域中诞生。这本书将带你回顾三个时代:研究人员从2018年之前普遍学习如何在偏好上进行强化学习(RL),2019至2022年期间学习如何将其应用于语言模型,2023年后则借鉴了ChatGPT的案例。就像早期扩展大语言模型(LLM)的研究者一样,十年前开创这个领域的人值得获得巨大赞誉,因为他们的工作为如今的发展奠定了基础。
本书第二章对这一主题进行了快速概述,但全书都充斥着这种思维方式。
4. 拆穿“知识蒸馏”的神秘面纱
在当前广泛的人工智能政策讨论背景下,拥有一章枯燥但实用的“知识蒸馏”教材内容非常有价值。第12章解释了如何使用大语言模型的输出来训练下游模型的各种行业标准方法。当这种技术常被描述为具有恶意目的或地缘政治竞争工具时,拿出一本300页的教科书来解释攻击者所针对的术语范围之广,这本身就是一种缓和局势的行为。
通过这一部分,第10至12章旨在让读者更清晰地理解数据行业的一些模糊实践。
知识蒸馏章节延续了我之前提到的主题,解释了需要做出的关键改变:如何将2015年早期的知识蒸馏文献转变为2-3个关键洞察,最终实现多教师策略的在线蒸馏(MOPD),如小米MiMo-V2-Flash和DeepSeek V4等模型。
5. 关于训练后阶段所有小麻烦的全面调查
本书的后半部分将带读者了解过度优化、正则化、评估和字符训练等内容,这些内容聚焦于训练后阶段可能出错的多种方式以及需要关注的重点。这正是本书区别于仅提供代码练习和方程列表的书籍之处,它解释了为什么RL在SFT遗忘时仍能泛化(在数学层面),以及前沿实验室如何塑造模型个性的技术,以及这些技术为何常常走向极端。本书不仅会介绍你将使用的工具,还会为你打开一扇通向实际应用时将面临所有挑战的大门。
当我撰写本书的要点总结时,我突然想起自己曾为人工智能时代的企业建设提供的一个古老建议,以及当前人们确实需要关注研究的重要性。随着人工智能领域的发展速度加快,一篇研究论文进入前沿模型所需的时间已缩短至3-9个月。在以往的大科技公司中,这个过程需要数年时间,因此对新研究采取放任态度是可行的。但对于依赖在特定LLM细分领域保持前沿地位的公司来说,如今的动态可能决定公司的成败。这本书的价值在于它能训练你理解哪些研究真正重要——它能帮助你培养研究品味。
如果以上内容没有引起你的共鸣,你仍然应该购买我的书,因为它让我感到开心,而我对所有内容都投入了大量心血。
我非常喜欢这张照片。
上一页
下一页