Reinforcement Learning with Neural Networks: Essential Concepts
TL;DR · AI 摘要
本文深入讲解了强化学习与神经网络结合的基本概念,包括状态、动作、奖励和价值函数等。
核心要点
- 强化学习涉及状态、动作和奖励。
- 神经网络用于估计价值函数。
- 策略迭代和价值迭代是强化学习的核心算法。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 强化学习与神经网络
金句 / Highlights
值得收藏与分享的关键句。
强化学习涉及状态、动作和奖励,这些是其基本组成部分。
神经网络可以用来估计价值函数,从而指导决策过程。
策略迭代和价值迭代是强化学习中的两种核心算法。
视频笔记
强化学习与神经网络:核心概念 - YouTube
返回 
跳过导航
搜索
用声音搜索
[](https://www.youtube.com/watch?v=9hbQieQh7-o)

[](https://www.youtube.com/watch?v=9hbQieQh7-o)
[](https://www.youtube.com/watch?v=9hbQieQh7-o)
[](https://www.youtube.com/watch?v=9hbQieQh7-o)
[](https://www.youtube.com/watch?v=9hbQieQh7-o)
[](https://www.youtube.com/watch?v=9hbQieQh7-o)
轻触以取消静音
2倍速
强化学习与神经网络:核心概念
StatQuest with Josh Starmer 50,721 观看次数 1年前
[](https://www.youtube.com/watch?v=9hbQieQh7-o)
搜索
复制链接
信息
购物
如果播放无法立即开始,请尝试重启设备。
•
您已退出登录
您观看的视频可能会被添加到电视的观看历史中,并影响电视推荐。为了避免这种情况,请取消并使用电脑上的 YouTube 登录。
取消 确认
[](https://www.youtube.com/watch?v=9hbQieQh7-o)
分享
[](https://www.youtube.com/watch?v=9hbQieQh7-o "分享链接")- [x] 包含播放列表
检索共享信息时发生错误。请稍后再试。
0:00
[](https://www.youtube.com/watch?v=9hbQieQh7-o)[](https://www.youtube.com/watch?v=DVGmsnxB2UQ "下一个 (SHIFT+n)")
0:00 / 0:00
直播
•完整观看视频
•
超赞的歌曲和介绍
•
18:13 强化学习:核心概念 StatQuest with Josh Starmer 94K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)25:01 使用神经网络的强化学习:数学细节 StatQuest with Josh Starmer 29K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)18:54 神经网络的核心思想 StatQuest with Josh Starmer 1.3M 观看次数 • 5年前 直播 播放列表 ()混合 (50+)24:50 强化学习:实用介绍 Shaw Talebi 6.4K 观看次数 • 3个月前 直播 播放列表 ()混合 (50+)33:04 强化学习的视觉指南 - 使它“点击”的6件事 Neural Breakdown with AVB 6K 观看次数 • 7个月前 直播 播放列表 ()混合 (50+)36:26 友好的深度强化学习介绍,Q网络和策略梯度 Luis Serrano Academy 142K 观看次数 • 4年前 直播 播放列表 ()混合 (50+)16:35 熵(数据科学)清晰解释!!!StatQuest with Josh Starmer 858K 观看次数 • 4年前 直播 播放列表 ()混合 (50+)18:02 带有人类反馈的强化学习(RLHF),清晰解释!!!StatQuest with Josh Starmer 57K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)18:40 但什么是神经网络?| 深度学习 第1章 3Blue1Brown 23M 观看次数 • 8年前 直播 播放列表 ()混合 (50+)26:03 强化学习:机器学习遇见控制理论 Steve Brunton 382K 观看次数 • 5年前 直播 播放列表 ()混合 (50+)32:32 预测几乎所有事物的奇怪数学 Veritasium 11M 观看次数 • 9个月前 直播 播放列表 ()混合 (50+)
1倍速
登录以确认您不是机器人 这有助于保护我们的社区。了解更多
强化学习与神经网络:核心概念
StatQuest with Josh Starmer
1.63M 订阅者
加入
订阅
已订阅
1.3K
分享
50K 观看次数 1年前#StatQuest
50,721 观看次数 • 2025年4月6日 #StatQuest
强化学习帮助神经网络学会了如何赢得游戏、驾驶汽车,甚至让 ChatGPT 在回应您的提示时听起来更像人类。这个 StatQuest 覆盖了这一过程的核心概念。BAM! ……更多
……更多
章节
查看所有

#### 回顾反向传播
4:01

#### 标准反向传播的问题
6:25

#### 通过猜测计算导数
7:04

#### 使用奖励更新导数
11:20

#### 替代奖励
14:56

#### 使用更新后的导数更新参数
16:01

#### 第二个示例
16:56
Transcript
跟随字幕进行学习。
显示字幕

视频关于

强化学习与神经网络:StatQuest 数学细节 由 Josh Starmer 的 StatQuest

显示更少
[](https://www.youtube.com/hashtag/statquest)#StatQuest
强化学习与神经网络:核心概念
50,721 视频观看 50K 视频观看
2025 年 4 月 6 日
1.3K
分享
保存
下载
下载
访问 StatQuest with Josh Starmer 商店

Top Show 特色评论最新 Show 最近的评论,包括可能的垃圾评论
添加评论...
由 @statquest 置顶
[@statquest](https://www.youtube.com/@statquest)
通过购买我的书籍《StatQuest机器学习插图指南》、《StatQuest神经网络与AI插图指南》或学习指南和商品来支持StatQuest!https://statquest.org/statquest-store/
显示更少 阅读更多
喜欢
6
不喜欢
回复
·
7 条回复
·
隐藏回复
·
7 条回复
[@yoki1288](https://www.youtube.com/@yoki1288)
Josh - 你的奉献精神帮助人们学习如此重要的概念,这对我们来说意义重大。你是最好的!!!
显示更少 阅读更多
喜欢
35
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@osmanalenbey5427](https://www.youtube.com/@osmanalenbey5427)
开始一周的最佳方式就是观看Josh Starmer的教育视频。砰!
显示更少 阅读更多
喜欢
7
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@VinayBettadapura](https://www.youtube.com/@VinayBettadapura)
$50.00
非常喜欢你的视频!砰!
显示更少 阅读更多
喜欢
3
不喜欢
❤ 由 @statquest
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@daniele3758](https://www.youtube.com/@daniele3758)
谢谢你,Josh。你总是很棒!!
显示更少 阅读更多
喜欢
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@felipe1930](https://www.youtube.com/@felipe1930)
期待下一个视频! 😁
显示更少 阅读更多
喜欢
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@sagrika7410](https://www.youtube.com/@sagrika7410)
你的视频太棒了!!非常感谢,Josh!!
显示更少 阅读更多
喜欢
1
不喜欢
❤ 由 @statquest
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@jiashengfan2269](https://www.youtube.com/@jiashengfan2269)
谢谢你,Josh,你的解释真是太好了。
显示更少 阅读更多
像
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@naturebloomers3470](https://www.youtube.com/@naturebloomers3470)
你真棒,兄弟!继续加油!
显示更少 阅读更多
喜欢
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@ktostam3478](https://www.youtube.com/@ktostam3478)
我爱“正常”通常;一如既往地做得很好!
显示更少 阅读更多
喜欢
2
不喜欢
❤ 由 @statquest
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@lakshmikousikmuvvala2915](https://www.youtube.com/@lakshmikousikmuvvala2915)
嘿,Josh,你是最棒的。
显示更少 阅读更多
喜欢
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@rfgsgsrgrfgrgfrg2670](https://www.youtube.com/@rfgsgsrgrfgrgfrg2670)
非常感谢你,Josh!!!
显示更少 阅读更多
喜欢
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@ramchandracheke](https://www.youtube.com/@ramchandracheke)
你太棒了!
显示更少 阅读更多
喜欢
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@imadsaddik](https://www.youtube.com/@imadsaddik)
我一直乘坐ABC列车,谢谢你,Josh
显示更少 阅读更多
喜欢
7
不喜欢
❤ 由 @statquest
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@Kevin.Kawchak](https://www.youtube.com/@Kevin.Kawchak)
谢谢,很棒的演讲
显示更少 阅读更多
喜欢
1
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@mehrankhodai7802](https://www.youtube.com/@mehrankhodai7802)
我已经看了很多视频,但你的视频与众不同,非常感谢。现在我只需要弄清楚如何编写一个RL模型。
显示更少 阅读更多
喜欢
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@livr6071](https://www.youtube.com/@livr6071)
Josh,我是你的超级粉丝!感谢过去几年!<3 我想知道你是否可以制作一个关于IAA指标(Cohen's kappa,Scott's pi,百分比一致性)的视频。有很多关于它的讨论,而你是唯一能把它讲得清晰易懂的人!我知道!
显示更少 阅读更多
喜欢
3
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@ADT3C](https://www.youtube.com/@ADT3C)
谢谢,兄弟
显示更少 阅读更多
喜欢
2
不喜欢
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@zaindevexp](https://www.youtube.com/@zaindevexp)
精彩
显示较少 阅读更多
赞
1
踩
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@eliasboulham](https://www.youtube.com/@eliasboulham)
非常好,你是最好的。<<就像在关键时刻做决定,并说,“对不起,我忘了乘以负一”,如果你错了的话。>>
显示较少 阅读更多
赞
1
踩
回复
·
1 条回复
·
隐藏回复
·
1 条回复