How LLMs Learn to Be Helpful (RLHF vs DPO)
本文对比RLHF与DPO两种方法,揭示大语言模型如何通过偏好学习提升帮助性,解析训练三阶段及技术局限性。
入选理由:模型训练分三阶段:预训练、监督微调(SFT)、偏好教学(RLHF/DPO)
概念
别名:监督微调
监督微调技术
已跟踪 9 条高相关材料
最近变化
2026-07-14 · 模型训练分三阶段:预训练、监督微调(SFT)、偏好教学(RLHF/DPO)
为什么值得关注
SFT 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
How LLMs Learn to Be Helpful (RLHF vs DPO)
ByteByteGo Newsletter · 8.5 分
本文对比RLHF与DPO两种方法,揭示大语言模型如何通过偏好学习提升帮助性,解析训练三阶段及技术局限性。
Kimi 2.7 is now fully trainable on Fireworks. Feed your data into Kimi and build a moat that beats ...
Fireworks AI(@FireworksAI_HQ) · 8.5 分
Fireworks AI 现在支持 Kimi 2.7 的完全可训练,提供低成本构建竞争模型的方案。
Fine-tuning on your proprietary data is the highest leverage thing you can do. Prompts get copied ov...
Fireworks AI(@FireworksAI_HQ) · 7.8 分
微调专有数据是构建AI护城河的最高杠杆策略,提示词易被复制,而基于私有数据训练的模型难以被替代。OpenAI正逐步限制该路径,企业应尽快掌握SFT能力。
已收录 9 条与 SFT 相关的内容,按评分排序。
本文对比RLHF与DPO两种方法,揭示大语言模型如何通过偏好学习提升帮助性,解析训练三阶段及技术局限性。
入选理由:模型训练分三阶段:预训练、监督微调(SFT)、偏好教学(RLHF/DPO)
Fireworks AI 现在支持 Kimi 2.7 的完全可训练,提供低成本构建竞争模型的方案。
入选理由:Kimi 2.7 可通过 Fireworks AI 进行 SFT、DPO 和 RL 训练。
Fine-tuning on proprietary data is the most strategic AI advantage; prompts are easily copied, while models trained on private data are hard to replicate. OpenAI is restricting this path—companies must act now to retain SFT control.
入选理由:使用专有数据进行SFT微调可建立竞争壁垒,防止提示工程被快速复制。
Fireworks AI 平台正式支持智谱 GLM 5.1 模型,提供 SFT/DPO 微调能力、200K 超长上下文窗口,专为长周期智能体编程微调优化,RL 训练即将上线。
入选理由:GLM 5.1 已集成至 Fireworks AI 托管与 API 训练工作流
Fireworks AI 宣布 Qwen 3.5 正式接入其训练平台,支持 SFT/DPO/RLHF 等全栈微调方式、256K 上下文及 LoRA/全参微调。
入选理由:Qwen 3.5 已上线 Fireworks AI 训练平台,覆盖托管与 API 两种工作流
Fireworks AI 扩展其训练平台,支持 Nemotron 3 Ultra 模型的微调和 DPO 训练。
入选理由:Nemotron 3 Ultra 现在支持 SFT 和 DPO 训练。
Spotify builds a highly steerable personalized recommendation system for 750M users and 100M+ tracks by transforming user action sequences into vectors and then tokens, combining content representation with LLMs.
入选理由:Spotify AI基础团队通过CPT和SFT微调开源权重LLM来构建推荐系统。
Cursor团队在v9模型训练中贡献工程进展,但补充数据效果有限。
入选理由:Cursor团队在v9 SFT和RL训练中做出重大工程贡献
This article discusses the underlying mechanism of large model SFT (Self-Training), aiming to put an end to practice controversies and avoid fruitless computing power. By deeply understanding the SFT mechanism, engineers can more effectively utilize resources and avoid unnecessary calculations.
入选理由:SFT机制可以有效减少算力浪费,提高模型训练效率。