How LLMs Learn to Be Helpful (RLHF vs DPO)
本文对比RLHF与DPO两种方法,揭示大语言模型如何通过偏好学习提升帮助性,解析训练三阶段及技术局限性。
入选理由:模型训练分三阶段:预训练、监督微调(SFT)、偏好教学(RLHF/DPO)
概念
别名:监督微调
监督微调技术
已跟踪 9 条高相关材料
最近变化
2026-07-14 · 模型训练分三阶段:预训练、监督微调(SFT)、偏好教学(RLHF/DPO)
为什么值得关注
SFT 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
How LLMs Learn to Be Helpful (RLHF vs DPO)
ByteByteGo Newsletter · 8.5 分
本文对比RLHF与DPO两种方法,揭示大语言模型如何通过偏好学习提升帮助性,解析训练三阶段及技术局限性。
Kimi 2.7 is now fully trainable on Fireworks. Feed your data into Kimi and build a moat that beats ...
Fireworks AI(@FireworksAI_HQ) · 8.5 分
Fireworks AI 现在支持 Kimi 2.7 的完全可训练,提供低成本构建竞争模型的方案。
Fine-tuning on your proprietary data is the highest leverage thing you can do. Prompts get copied ov...
Fireworks AI(@FireworksAI_HQ) · 7.8 分
微调专有数据是构建AI护城河的最高杠杆策略,提示词易被复制,而基于私有数据训练的模型难以被替代。OpenAI正逐步限制该路径,企业应尽快掌握SFT能力。
已收录 9 条与 SFT 相关的内容,按评分排序。
本文对比RLHF与DPO两种方法,揭示大语言模型如何通过偏好学习提升帮助性,解析训练三阶段及技术局限性。
入选理由:模型训练分三阶段:预训练、监督微调(SFT)、偏好教学(RLHF/DPO)
Fireworks AI 现在支持 Kimi 2.7 的完全可训练,提供低成本构建竞争模型的方案。
入选理由:Kimi 2.7 可通过 Fireworks AI 进行 SFT、DPO 和 RL 训练。
微调专有数据是构建AI护城河的最高杠杆策略,提示词易被复制,而基于私有数据训练的模型难以被替代。OpenAI正逐步限制该路径,企业应尽快掌握SFT能力。
入选理由:使用专有数据进行SFT微调可建立竞争壁垒,防止提示工程被快速复制。
Fireworks AI 平台正式支持智谱 GLM 5.1 模型,提供 SFT/DPO 微调能力、200K 超长上下文窗口,专为长周期智能体编程微调优化,RL 训练即将上线。
入选理由:GLM 5.1 已集成至 Fireworks AI 托管与 API 训练工作流
Fireworks AI 宣布 Qwen 3.5 正式接入其训练平台,支持 SFT/DPO/RLHF 等全栈微调方式、256K 上下文及 LoRA/全参微调。
入选理由:Qwen 3.5 已上线 Fireworks AI 训练平台,覆盖托管与 API 两种工作流
Fireworks AI 扩展其训练平台,支持 Nemotron 3 Ultra 模型的微调和 DPO 训练。
入选理由:Nemotron 3 Ultra 现在支持 SFT 和 DPO 训练。
Spotify通过将用户行为序列转化为向量再映射为Token,结合内容表征与LLM,构建高度可操控的个性化推荐系统,以服务7.5亿用户与1亿+曲库。
入选理由:Spotify AI基础团队通过CPT和SFT微调开源权重LLM来构建推荐系统。
Cursor团队在v9模型训练中贡献工程进展,但补充数据效果有限。
入选理由:Cursor团队在v9 SFT和RL训练中做出重大工程贡献
本文讨论了大模型SFT的底层机理,旨在终结实践争议,规避无效算力。通过深入理解SFT机制,工程师可以更有效地利用资源,避免浪费。
入选理由:SFT机制可以有效减少算力浪费,提高模型训练效率。