T
traeai
登录
返回首页
StatQuest视频

Reinforcement Learning with Human Feedback (RLHF), Clearly Explained!!!

8.5内容质量
可直接观看的视频资源打开原视频

TL;DR · AI 摘要

Reinforcement Learning with Human Feedback (RLHF)是一种结合人类反馈来改进机器学习模型的方法,显著提高了模型性能。

核心要点

  • RLHF通过人类反馈改进模型性能。
  • RLHF在多个领域有广泛应用。
  • RLHF结合了强化学习和监督学习的优点。

结构提纲

按章节快速跳转。

  1. 介绍Reinforcement Learning with Human Feedback (RLHF)的基本概念。

  2. 详细解释RLHF的工作机制,包括如何收集和利用人类反馈。

  3. 探讨RLHF在不同领域的应用实例。

  4. 分析RLHF相比传统方法的优势。

  5. 总结RLHF的重要性和未来发展方向。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Reinforcement Learning with Human Feedback (RLHF)

金句 / Highlights

值得收藏与分享的关键句。

#Reinforcement Learning#Human Feedback#Machine Learning

视频笔记

强化学习与人类反馈(RLHF),清晰解释!!! - YouTube

返回 ![图像 1](https://www.youtube.com/ "YouTube 首页")

跳过导航

搜索

用声音搜索

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

登录

![图像 2](https://www.youtube.com/ "YouTube 首页")

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

强化学习与人类反馈(RLHF),清晰解释!!!

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

轻触取消静音

2倍速

图像 3
图像 3

强化学习与人类反馈(RLHF),清晰解释!!!

StatQuest with Josh Starmer 57,390 观看次数 1年前

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

搜索

复制链接

信息

购物

图像 4
图像 4
图像 5
图像 5

如果播放很快无法开始,请尝试重启设备。

您已退出登录

您观看的视频可能会被添加到电视的观看历史中,并影响电视推荐。为了避免这种情况,请取消并使用计算机上的 YouTube 登录。

取消 确认

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)

分享

[](https://www.youtube.com/watch?v=qPN_XZcJf_s "分享链接")- [x] 包含播放列表

检索共享信息时发生错误。请稍后再试。

图像 6
图像 6

0:00

[](https://www.youtube.com/watch?v=qPN_XZcJf_s)[](https://www.youtube.com/watch?v=9hbQieQh7-o "下一个 (SHIFT+n)")

0:00 / 0:00

直播

•完整观看视频

超赞的歌曲和介绍

18:13 强化学习:基本概念 StatQuest with Josh Starmer 94K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)27:14 变换器,LLM 背后的技术 | 深度学习 第五章 3Blue1Brown 10M 观看次数 • 2年前 直播 播放列表 ()混合 (50+)28:53 基于人类反馈的微调 LLM(RLHF + DPO)Shaw Talebi 23K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)11:10 RAG 是否仍然必要?选择最佳方法以应对 LLMs IBM Technology 730K 观看次数 • 2个月前 直播 播放列表 ()混合 (50+)22:51 如何用超级简单的方式解释 AI 是如何工作的!!!StatQuest with Josh Starmer 28K 观看次数 • 3个月前 直播 播放列表 ()混合 (50+)24:00 使用神经网络的强化学习:基本概念 StatQuest with Josh Starmer 50K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)32:32 预测几乎所有事物的奇怪数学 Veritasium 11M 观看次数 • 9个月前 直播 播放列表 ()混合 (50+)56:40 不学习这些基础知识就不要学 AI 代理 KodeKloud 754K 观看次数 • 6个月前 直播 播放列表 ()混合 (50+)11:29 基于人类反馈的强化学习(RLHF)解释 IBM Technology 86K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)19:51 Yann LeCun 在做什么?JEPA 简单解释 bycloud 98K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)57:45 可视化变换器和注意力机制 | TNG 大科技日 '24 的演讲 Grant Sanderson 1.2M 观看次数 • 1年前 直播 播放列表 ()混合 (50+)15:14 为什么推理很难..Caleb Writes Code 133K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)

1倍速

登录以确认您不是机器人 这有助于保护我们的社区。了解详情

登录

强化学习与人类反馈(RLHF),清晰解释!!!

图像 7: StatQuest with Josh Starmer
图像 7: StatQuest with Josh Starmer

StatQuest with Josh Starmer

StatQuest with Josh Starmer

1.63M 订阅者

加入

订阅

已订阅

1.5K

分享

57K 观看次数 1年前#StatQuest

57,390 观看次数 • 2025年5月4日 • #StatQuest

生成式大型语言模型,如 ChatGPT 和 DeepSeek,是在大规模文本数据集上训练的,例如整个维基百科。然而,仅靠这种训练不足以教会模型如何生成有礼貌且有用的响应。因此,LLMs 依赖于监督微调和基于人类反馈的强化学习(RLHF)来对齐模型……更多

...更多

章节

查看全部

![Image 9 #### 预训练大型语言模型(LLM) #### 预训练大型语言模型(LLM) 2:25](https://www.youtube.com/watch?v=qPN_XZcJf_s&t=145s)

#### 预训练大型语言模型(LLM)

2:25

支持 StatQuest 的方法是购买我的书籍《StatQuest 机器学习图解指南》、《StatQuest 神经网络与人工智能图解指南》或学习指南和周边商品!!!https://statquest.org/statquest-store/

显示较少 阅读更多

喜欢

不喜欢

回复

图像 25
图像 25

[@Anonymoooous](https://www.youtube.com/@Anonymoooous)

9 个月前

₹179.00

觉得免费观看不对劲,所以……砰!图像 26: 💥

显示较少 阅读更多

喜欢

不喜欢

图像 27
图像 27

❤ 由 @statquest

回复

图像 28
图像 28

·

1 条回复

图像 29
图像 29

·

隐藏回复

图像 30: StatQuest with Josh Starmer
图像 30: StatQuest with Josh Starmer

·

1 条回复

图像 31
图像 31

[@babarali4313](https://www.youtube.com/@babarali4313)

1 年前

老兄,你被低估了。我从未有任何疑问地离开过任何一个视频。出色的工作。

显示较少 阅读更多

喜欢

不喜欢

回复

图像 32
图像 32

·

2 条回复

图像 33
图像 33

·

隐藏回复

图像 34: StatQuest with Josh Starmer
图像 34: StatQuest with Josh Starmer

·

2 条回复

图像 35
图像 35

[@rsaleh8957](https://www.youtube.com/@rsaleh8957)

11 个月前

易于跟从且与时俱进。期待 PPO 和 GRPO。

显示较少 阅读更多

喜欢

不喜欢

回复

图像 36
图像 36

·

2 条回复

图像 37
图像 37

·

隐藏回复

图像 38: StatQuest with Josh Starmer
图像 38: StatQuest with Josh Starmer

·

2 条回复

图像 39
图像 39

[@redean0230](https://www.youtube.com/@redean0230)

6 个月前

感谢开场歌曲。

显示较少 阅读更多

喜欢

不喜欢

回复

图像 40
图像 40

·

1 条回复

图像 41
图像 41

·

隐藏回复

图像 42
图像 42

·

1 条回复

图像 43
图像 43

1 年前

Triple BAM!!!!! 真棒的视频,感谢提到我!:)

显示更少 阅读更多

赞同

4

反对

图片 60
图片 60

❤ 由 @statquest

回复

图片 61
图片 61

·

1 条回复

图片 62
图片 62

·

隐藏回复

图片 63
图片 63

·

1 条回复

图片 64
图片 64

[@Gabriel-lx6rn](https://www.youtube.com/@Gabriel-lx6rn)

8 个月前

我不知道为什么,但你的视频让我感到怀旧,不知为何。我想它们让我想起了过去的电视纪录片和课堂。无论如何,你的视频非常容易理解,不会低估观众的智力,同时还能保持有趣和轻松。你应该因为这个获得成千上万的关注。非常感谢你,伙计!!!!!!

显示更少 阅读更多

赞同

3

反对

图片 65
图片 65

❤ 由 @statquest

回复

图片 66
图片 66

·

1 条回复

图片 67
图片 67

·

隐藏回复

图片 68
图片 68

·

1 条回复

图片 69
图片 69

[@YesidRomero-f5n](https://www.youtube.com/@YesidRomero-f5n)

11 个月前

你非常擅长解释人工智能中的复杂概念。很棒的频道!

显示更少 阅读更多

赞同

1

反对

回复

图片 70
图片 70

·

1 条回复

图片 71
图片 71

·

隐藏回复

图片 72
图片 72

·

1 条回复

图片 73
图片 73

[@ahmedshenawy8732](https://www.youtube.com/@ahmedshenawy8732)

10 个月前

感谢清晰流畅的解释!图片 74: ❤

显示更少 阅读更多

赞同

1

反对

回复

图片 75
图片 75

·

1 条回复

图片 76
图片 76

·

隐藏回复

图片 77
图片 77

·

1 条回复

图片 78
图片 78

[@Elnono75007](https://www.youtube.com/@Elnono75007)

1 年前

感谢所有的视频。你让我希望我能全职尝试自己构建所有东西。我可能会遇到很多困难,但你让这一切看起来是可以实现的。继续加油!

显示更少 阅读更多

赞同

1

反对

回复

图片 79
图片 79

·

1 条回复

图片 80
图片 80

·

隐藏回复

图片 81
图片 81

·

1 条回复

图片 82
图片 82

[@HungLe-pk3oz](https://www.youtube.com/@HungLe-pk3oz)

11 个月前

你好,Josh!我拿到了“StatQuest IIIustrated Guide To Machine Learning”,我必须来这里说声谢谢。你太棒了!!

显示更少 阅读更多

赞同

1

反对

图片 83
图片 83

❤ 由 @statquest

回复

图片 84
图片 84

·

1 条回复

图片 85
图片 85

·

隐藏回复

图片 86
图片 86

·

1 条回复

图片 87
图片 87

[@AvaSmith98](https://www.youtube.com/@AvaSmith98)

6 个月前(编辑)

非常感谢你制作这一系列视频!我已经花了很多时间观看这个播放列表,每个视频都是真正的宝贵资源。真的没有人能像你这样解释事情!希望将来你能涵盖图论!

显示更少 阅读更多

赞同

1

反对

图片 88
图片 88

❤ 由 @statquest

回复

图片 89
图片 89

·

1 条回复

图片 90
图片 90

·

隐藏回复

图片 91
图片 91

·

1 条回复

图片 92
图片 92

[@darshilshah8991](https://www.youtube.com/@darshilshah8991)

7 个月前

Josh,你的视频真的很有帮助。感谢精彩的内容。

显示更少 阅读更多

赞同

1

反对

回复

图片 93
图片 93

·

1 条回复

图片 94
图片 94

·

隐藏回复

图片 95
图片 95

·

1 条回复

图片 96
图片 96

[@hasansiddiki7162](https://www.youtube.com/@hasansiddiki7162)

6 个月前

到目前为止,我已经采用了你的说话风格。BaaaaaM!

显示更少 阅读更多

赞同

4

反对

图片 97
图片 97

❤ 由 @statquest

回复

图片 98
图片 98

·

1 条回复

图片 99
图片 99

·

隐藏回复

图片 100
图片 100

·

1 条回复

图片 101
图片 101

[@Triumph-qt](https://www.youtube.com/@Triumph-qt)

10个月前

感谢,我在这里学到了很多关于llm和rl的知识

显示较少 阅读更多

1

不喜欢

回复

图片 102
图片 102

·

1 条回复

图片 103
图片 103

·

隐藏回复

图片 104
图片 104

·

1 条回复

图片 105
图片 105

[@thenoblerot](https://www.youtube.com/@thenoblerot)

一年前

您的图片 106: ✨审美图片 107: ✨仅次于优质的内容

显示较少 阅读更多

1

不喜欢

回复

图片 108
图片 108

·

1 条回复

图片 109
图片 109

·

隐藏回复

图片 110
图片 110

·

1 条回复

图片 111
图片 111

[@ankk98](https://www.youtube.com/@ankk98)

8个月前

您是一位伟大的老师!

显示较少 阅读更多

1

不喜欢

回复

图片 112
图片 112

·

1 条回复

图片 113
图片 113

·

隐藏回复

图片 114
图片 114

·

1 条回复

AI 可能会生成不准确的信息,请核实重要内容