#677.Post-Traning 前沿现状与问题

播客收听
问这期播客
会先在本集摘要、章节、转录和笔记里找答案。
TL;DR · AI 摘要
大模型后训练技术正从经典配方转向多教师在线策略蒸馏等新范式,但面临组织能力极限与教师模型差异等挑战。
核心要点
- DPO因工业化流程而衰落,但仍是粗糙阶段的高效选择
- 多教师在线策略蒸馏需调整RL配置,2026年成新范式
- 中国实验室更分享具体细节,如温度调度与难度课程
结构提纲
按章节快速跳转。
- §引言
播客介绍AI2研究员Finbarr Timbers与Nathan的深度对话,聚焦后训练技术演进。
梳理InstructGPT三阶段框架到Llama3的拒绝采样、DPO等技术迭代。
分析DPO因流程精细化而失效,偏好损失函数带来显著提升。
2026年新方法通过RL框架实现教师模型对齐,需微调现有配置。
英伟达发现教师模型分布差异导致蒸馏失败,需分阶段蒸馏解决。
对比中美实验室在细节分享、算力经济和职业选择上的不同策略。
金句 / Highlights
值得收藏与分享的关键句。
「把OMO3后训练成推理模型,对很多人来说都是一项重大成就」——现代后训练拼的是算力与数据整合能力
「当你的配方越来越干净的时候,DPO的需求基本上就消失了」——工业化流程淘汰低效方法
「实现多教师蒸馏只需对现有RL配置做一小套调整」——2026年新范式技术门槛降低
「教师和学生若用不同SFT数据训练,会习得不同推理行为」——英伟达Nematron 3 Ultra论文关键发现
「中国实验室更愿意分享那种特别特别具体的细节」——温度调度与难度课程等可操作配方
章节
欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄
欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄
Finbarr 成为节目首位返场嘉宾
Finbarr 成为节目首位返场嘉宾
两人在 AI2 共事后训练的缘起
两人在 AI2 共事后训练的缘起
今天是 Finbarr 在 AI2 的最后一天
今天是 Finbarr 在 AI2 的最后一天
从 OMO3 聊起:推理模型后训练的复杂度
从 OMO3 聊起:推理模型后训练的复杂度
现代后训练的本质:整合组织架构图
现代后训练的本质:整合组织架构图
TULU3 之后的分岔点:简单配方 vs 前沿做法
TULU3 之后的分岔点:简单配方 vs 前沿做法
经典配方综述:InstructGPT、Llama 3、TULU3、DeepSeek R1
经典配方综述:InstructGPT、Llama 3、TULU3、DeepSeek R1
InstructGPT 三步法:SFT、奖励模型、RL
InstructGPT 三步法:SFT、奖励模型、RL
Llama 2/3 的迭代:拒绝采样、DPO、多轮训练
Llama 2/3 的迭代:拒绝采样、DPO、多轮训练
TULU3 的简化配方与组织规模的限制
TULU3 的简化配方与组织规模的限制
DeepSeek R1 的配方:RL-first 与冷启动 SFT
DeepSeek R1 的配方:RL-first 与冷启动 SFT
转录
欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄
Finbarr 成为节目首位返场嘉宾
两人在 AI2 共事后训练的缘起
今天是 Finbarr 在 AI2 的最后一天
从 OMO3 聊起推理模型后训练的复杂度
现代后训练的本质整合组织架构图
TULU3 之后的分岔点简单配方 vs 前沿做法
经典配方综述InstructGPT、Llama 3、TULU3、DeepSeek R1
InstructGPT 三步法SFT、奖励模型、RL
Llama 2/3 的迭代拒绝采样、DPO、多轮训练
TULU3 的简化配方与组织规模的限制
DeepSeek R1 的配方RL-first 与冷启动 SFT
DPO 从主流配方中消失的趋势
为什么配方越干净,DPO 需求越小
偏好调优是否被低估?
偏好损失函数带来的惊人提升
DeepSeek V4 与多教师在线策略蒸馏
MIMO Flash V2 命名该术语
多教师在线策略蒸馏的机制详解
Nematron 3 Ultra 的实践与挑战
英伟达的关键发现教师差异过大无法合并
分阶段蒸馏 vs 收敛后蒸馏的争论
微软 MAI 的保守配方选择
中国实验室的细节分享温度调度与难度课程
开源环境市场的疯狂现状
环境报价每个环境十万美金
Tinker 风格 API 的商业模式与争议
卖算力、卖推理与卖 API 的利润层级
热潮之下挤进实验室赚钱 vs 长期价值
探索与利用的取舍什么工作值得做
Finbarr 的职业经历DeepMind 与 AI2 的信念驱动
大实验室的体量困境与多样化路线
节目笔记
#677.Post-Traning 前沿现状与问题 - 跨国串门儿计划 | 小宇宙 - 听播客,上小宇宙
📝 本期播客简介
本期我们克隆了:The State of Frontier Post-Training Recipes | Conversation with Finbarr Timbers。节目讨论前沿大模型后训练(post-training)配方的现状与实践。
本期节目来自技术播客《Interconnects》,主持人 Nathan 与 AI2 研究员 Finbarr Timbers 展开了一场关于前沿大模型后训练配方演变的深度对谈。这也是该节目首次迎来返场嘉宾——Finbarr 曾在 AI2 与 Nathan 共同参与 OMO 系列模型的后训练工作,而录制当天恰好是他在 AI2 的最后一天,让这场对话多了一层告别与回顾的意味。
对话从经典配方讲起,一路梳理到多教师在线策略蒸馏(Multi-Teacher Online Policy Distillation)等最新趋势。两人不仅回顾了 InstructGPT 三阶段框架、Llama 3 与 TULU3 的实用落地、DeepSeek R1 的推理转向,还穿插了他们在 AI2 的实际经验——包括 OMO3 后训练如何逼近组织能力极限、为什么 DPO 正在从主流配方中消失,以及中国实验室与美国实验室在配方细节分享上的显著差异。如果你关心大模型后训练的技术细节、开源与工业界的差距,或者想了解前沿实验室内部的组织与决策逻辑,这期内容密度极高,值得反复收听。
👨⚕️ 本期嘉宾
Finbarr Timbers,AI2(Allen Institute for AI)研究员,专注于大模型后训练与强化学习。他此前曾在 DeepMind 阿尔伯塔办公室工作,参与过计算机扑克与博弈论研究,后加入 AI2 参与 OMO 系列模型的后训练工作。他是《Interconnects》节目首位返场嘉宾,对前沿后训练配方的演变有深入观察和一手经验。
⏱️ 时间戳
开场 & 节目背景
01:12 欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄
01:39 Finbarr 成为节目首位返场嘉宾
01:48 两人在 AI2 共事后训练的缘起
02:52 今天是 Finbarr 在 AI2 的最后一天
从 OMO3 到经典配方:后训练的组织极限
03:11 从 OMO3 聊起:推理模型后训练的复杂度
03:35 现代后训练的本质:整合组织架构图
04:16 TULU3 之后的分岔点:简单配方 vs 前沿做法
07:35 经典配方综述:InstructGPT、Llama 3、TULU3、DeepSeek R1
配方的工业化演进:从 InstructGPT 到 DeepSeek
09:49 InstructGPT 三步法:SFT、奖励模型、RL
10:40 Llama 2/3 的迭代:拒绝采样、DPO、多轮训练
11:59 TULU3 的简化配方与组织规模的限制
13:03 DeepSeek R1 的配方:RL-first 与冷启动 SFT
DPO 的衰落与偏好调优的争议
14:35 DPO 从主流配方中消失的趋势
15:01 为什么配方越干净,DPO 需求越小
16:27 偏好调优是否被低估?
16:54 偏好损失函数带来的惊人提升
多教师在线策略蒸馏:2026 年的新范式
21:06 DeepSeek V4 与多教师在线策略蒸馏
22:00 MIMO Flash V2 命名该术语
22:25 多教师在线策略蒸馏的机制详解
24:51 Nematron 3 Ultra 的实践与挑战
教师模型的困境与行业分歧
26:28 英伟达的关键发现:教师差异过大无法合并
27:18 分阶段蒸馏 vs 收敛后蒸馏的争论
29:05 微软 MAI 的保守配方选择
33:15 中国实验室的细节分享:温度调度与难度课程
开源环境、Tinker API 与算力经济
35:57 开源环境市场的疯狂现状
36:41 环境报价:每个环境十万美金
40:05 Tinker 风格 API 的商业模式与争议
42:14 卖算力、卖推理与卖 API 的利润层级
职业选择与长期价值
45:26 热潮之下:挤进实验室赚钱 vs 长期价值
45:44 探索与利用的取舍:什么工作值得做
48:41 Finbarr 的职业经历:DeepMind 与 AI2 的信念驱动
50:27 大实验室的体量困境与多样化路线
🌟 精彩内容
💡 "把 OMO3 后训练成推理模型,对很多人来说都是一项重大成就"
Nathan 坦言,OMO3 的后训练复杂度已经逼近 AI2 组织能力的极限。现代后训练拼的不是单一技术,而是把算力和数据整合进一条工作流的能力——本质上是在整合一张组织架构图。这也是为什么 OMO3 作为推理模型推出得相当晚,且配方相对简单。
"很多现代后训练,拼的就是你把算力和数据整合进一条工作流的能力。"
💡 配方趋同的分岔点出现在 TULU3 之后
在 TULU3 之前,大家还能说"做法都差不多"——SFT、DPO、RL 三阶段配方。但到了推理模型和带工具使用的 Agent 模型时代,那种简单配方已经不再适用。前沿实验室的做法与开放学术界的差距正在急剧拉大。
"可现在,把那种三阶段配方用在推理模型上,尤其是带工具使用的 Agent 模型上,就真的不太适用了。"
💡 DPO 的消失是配方工业化的必然结果
当后训练流程变得越来越精细、越来越工业化,DPO 能带来的边际收益就消失了。但在配方粗糙的阶段,DPO 依然是从零搭建时算力效率最高的选择之一。Nathan 直言:"用 DPO 的人可能会被看不起,但如果你是想把一个配方从零搭起来,它仍然管用。"
"当你的配方越来越干净的时候,这个需求基本上就消失了。"
💡 多教师在线策略蒸馏:把 RL 框架变成教师对齐的舞台
这是 2026 年最值得关注的后训练新范式:在 RL 框架内,让正在训练的学生模型采样轨迹,再路由给各个领域专家教师,用 KL 散度损失对齐。Finbarr 指出,实现起来其实很直接——只需要对现有 RL 配置做一小套调整。
"你拿你现有的 RL 配置,然后只需要对学习者模型做一小套调整,就能实现这个。"
💡 教师模型差异过大,蒸馏会失败
英伟达在 Nematron 3 Ultra 论文中披露了一个关键发现:用差异很大的训练流程训练出来的教师模型,无法通过简单的在线策略蒸馏有效合并。教师和学生若用不同 SFT 数据训练,会习得不同推理行为,导致学生轨迹对教师而言属于分布外数据。
"这种分布差异会导致学生生成的轨迹对教师来说属于分布外数据,从而降低教师提供的监督信号的质量和可靠性。"
💡 中国实验室更愿意分享"特别特别具体"的细节
从温度调度到难度课程,KIMI K2.5 和 GLM5 分享了大量可操作的配方细节——尽管两者在温度调度上声称的正好相反。相比之下,英伟达的论文更像一份方法列表,读起来没那么有意思。
"我还是觉得中国实验室更愿意分享那种特别特别具体的细节。"
💡 报酬最高的地方,往往也是你在做最有趣工作的地方
面对"梯子被抽走之前挤进实验室"的热潮,Finbarr 给出的判断是:要区分短期套利和长期价值。他职业生涯里反复看到,高薪与有趣工作往往是重合的——关键是追随信念,在某个领域做到足够强。
"往往报酬最高的地方,也正是你在做最有趣工作的地方。"
💡 开放环境市场:一个环境十万美金,但可能不包含提示词
Finbarr 分享了他年初尝试购买 RL 环境的经历:一个 DoorDash 克隆级别的环境,前期成本约十万美金,每年维护费约五万。但 Nathan 指出,真正值钱的是"我们知道这些提示词能提升某个基准测试"——那才能收高得多的溢价。
"如果你能说'我们有提示词,而且我们知道它们能提升某个基准测试或某项能力',那就能收高得多的溢价。"
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺;
如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight