Reinforcement Learning with Neural Networks: Mathematical Details
TL;DR · AI 摘要
本文详细探讨了神经网络在强化学习中的数学细节,包括价值函数、策略梯度等内容。
核心要点
- 理解价值函数和策略梯度在强化学习中的作用。
- 掌握神经网络如何应用于强化学习。
- 了解强化学习中的数学基础。
结构提纲
按章节快速跳转。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 强化学习中的数学细节
金句 / Highlights
值得收藏与分享的关键句。
价值函数是衡量状态或行为好坏的标准,对于强化学习至关重要。
策略梯度方法通过调整参数来优化策略,从而提高期望回报。
神经网络能够处理高维输入空间,使得强化学习更加灵活和高效。
视频笔记
强化学习与神经网络:数学细节 - YouTube
返回 
跳过导航
搜索
用声音搜索
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)
轻触取消静音
2倍速
强化学习与神经网络:数学细节
StatQuest with Josh Starmer 29,839 观看次数 1年前
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)
搜索
复制链接
信息
购物
如果播放很快没有开始,请尝试重启设备。
•
您已退出登录
您观看的视频可能会被添加到电视的观看历史中,并影响电视推荐。为了避免这种情况,请取消并登录到您的电脑上的 YouTube。
取消 确认
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)
分享
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ "分享链接")- [x] 包含播放列表
检索共享信息时发生错误。请稍后再试。
0:00
[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)[](https://www.youtube.com/watch?v=KphmOJnLAdI "下一个 (SHIFT+n)")
0:00 / 0:00
直播
•完整观看视频
•
超赞的歌曲和介绍
•
24:00 强化学习与神经网络:基本概念 StatQuest with Josh Starmer 50K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)59:36 政策梯度定理解释 - 强化学习 Elliot Waite 83K 观看次数 • 5年前 直播 播放列表 ()混合 (50+)23:01 什么是卷积?3Blue1Brown 3.5M 观看次数 • 3年前 直播 播放列表 ()混合 (50+)18:13 强化学习:基本概念 StatQuest with Josh Starmer 94K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)56:51 图灵奖得主:不同意谷歌、Postgres、未来问题 | Mike Stonebraker Ryan Peterman 279K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)33:25 我从未想象过的灾难 Veritasium 5.4M 观看次数 • 10天前 直播 播放列表 ()混合 (50+)26:03 强化学习:机器学习与控制理论 Steve Brunton 382K 观看次数 • 5年前 直播 播放列表 ()混合 (50+)37:25 Yann LeCun 的10亿美元赌注反对LLMs Welch Labs 382K 观看次数 • 8天前 直播 播放列表 ()混合 (50+)23:43 变换器神经网络背后的矩阵数学,一步一步讲解!!!StatQuest with Josh Starmer 89K 观看次数 • 2年前 直播 播放列表 ()混合 (50+)18:02 带有人类反馈的强化学习 (RLHF),清晰解释!!!StatQuest with Josh Starmer 57K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)40:08 机器学习中最重要算法 Artem Kirsanov 1M 观看次数 • 2年前 直播 播放列表 ()混合 (50+)16:27 强化学习简介 Arxiv Insights 708K 观看次数 • 8年前 直播 播放列表 ()混合 (50+)
1倍速
登录以确认您不是机器人 这有助于保护我们的社区。 了解更多
强化学习与神经网络:数学细节
StatQuest with Josh Starmer
1.63M 订阅者
加入
订阅
已订阅
748
分享
29K 观看次数 1年前 #StatQuest
29,839 观看次数 • 2025年4月13日 #StatQuest
我们逐步讲解了使用强化学习更新神经网络参数所需的数学知识。我们展示了如何计算导数(BAM!),然后更新它们(DOUBLE BAM!!),最后用于优化参数(TRIPLE BAM!!!)。……更多
……更多
章节
查看全部

#### Awesome song and introduction
0:00

#### 计算导数
4:09

#### 使用奖励更新导数
12:16

#### 更新神经网络中的参数
15:39

#### 第二个示例
16:28
Transcript
跟随字幕进行学习。
显示字幕

视频关于
强化学习:StatQuest 中的核心概念由 Josh Starmer 解释


显示更少
[](https://www.youtube.com/hashtag/statquest)#StatQuest
强化学习与神经网络:数学细节
29,839 视频观看次数
29K 视频观看次数
2025年4月13日
748
分享
保存
下载
下载
浏览 StatQuest with Josh Starmer 商店

68 条评论
排序评论
按
添加一条评论...
@statquest 置顶
[@statquest](https://www.youtube.com/@statquest)
通过购买我的书籍《StatQuest机器学习图解指南》、《StatQuest神经网络和AI图解指南》或学习指南和商品来支持StatQuest!!! https://statquest.org/statquest-store/
显示更少 阅读更多
喜欢
5
不喜欢
回复
[@UnconditionalBeta](https://www.youtube.com/@UnconditionalBeta)
“链式法则”——每次听到这个词我都会笑。没想到学习这些复杂的东西会这么有趣!
显示较少 阅读更多
喜欢
不喜欢
❤ 来自 @statquest
回复
·
1 回复
·
隐藏回复
·
1 回复
[@william_8844](https://www.youtube.com/@william_8844)
终于等到了这个!😄
显示较少 阅读更多
喜欢
不喜欢
回复
·
1 回复
·
隐藏回复
·
1 回复
[@radhikab4864](https://www.youtube.com/@radhikab4864)
Josh,你太棒了!
显示较少 阅读更多
喜欢
不喜欢
回复
·
1 回复
·
隐藏回复
·
1 回复
[@Uniquekeyz](https://www.youtube.com/@Uniquekeyz)
Josh Starmer,你绝对是最好的,我喜欢你的视频,我爱这个频道 ❤
显示较少 阅读更多
喜欢
不喜欢
回复
·
1 回复
·
隐藏回复
·
1 回复
[@iqra2291](https://www.youtube.com/@iqra2291)
我一直期待着这个 ❤🎉
显示较少 阅读更多
喜欢
不喜欢
❤ 来自 @statquest
回复
·
2 回复
·
隐藏回复
·
2 回复
[@Vibe-Math](https://www.youtube.com/@Vibe-Math)
谢谢您,先生!
显示较少 阅读更多
喜欢
不喜欢
回复
·
1 回复
·
隐藏回复
·
1 回复
[@alihaghighat1244](https://www.youtube.com/@alihaghighat1244)
嗨,Josh!我从您的内容中做了笔记。感谢您简化了复杂的强化学习概念。😊
显示较少 阅读更多
喜欢
不喜欢
❤ 来自 @statquest
回复
·
2 回复
·
隐藏回复
[@pashamorozov8257](https://www.youtube.com/@pashamorozov8257)
哇!感谢强化学习!
显示较少 阅读更多
喜欢
不喜欢
回复
·
1 回复
·
隐藏回复
[@neelkamal3357](https://www.youtube.com/@neelkamal3357)
数学棒极了!!!
显示较少 阅读更多
喜欢
不喜欢
回复
·
1 回复
·
隐藏回复
[@k10shetty](https://www.youtube.com/@k10shetty)
在强化学习中,我们总是假设所选动作是正确的来计算损失。总是猜测我们采取的动作是正确的。
显示更少 阅读更多
赞同
2
反对
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@ertugruluyar.social](https://www.youtube.com/@ertugruluyar.social)
你好,感谢精彩的视频。你能做一个播放列表来涵盖层次线性模型(混合模型)吗?
显示更少 阅读更多
赞同
反对
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@planecrazy242](https://www.youtube.com/@planecrazy242)
这让我头疼!
显示更少 阅读更多
赞同
1
反对
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@jauharulumam1683](https://www.youtube.com/@jauharulumam1683)
你好,Josh。来自印尼。
显示更少 阅读更多
赞同
1
反对
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@festashabani20](https://www.youtube.com/@festashabani20)
嘿,Josh,感谢你精彩的视频!问题:你用什么工具制作这些幻灯片和图表等等?
显示更少 阅读更多
赞同
1
反对
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@mbeugelisall](https://www.youtube.com/@mbeugelisall)
如果没有你的视频,我不认为我能赢得奖学金或在喷气推进实验室的实习机会。我向你保证我的第一个孩子。
显示更少 阅读更多
赞同
27
反对
❤ 由 @statquest
回复
·
2 条回复
·
隐藏回复
·
2 条回复
[@gsestream](https://www.youtube.com/@gsestream)
二进制多变量PCA应该很有趣。每个轴只有0或1,而不是任意浮点值。用于二进制神经网络的梯度下降。
显示更少 阅读更多
赞同
反对
回复
[@eliasboulham](https://www.youtube.com/@eliasboulham)
“如果他们说,‘再试一次,别忘了乘以负一’,那么我会使用第一次试验得到的不平衡骰子重新猜测。如果我犯了错误,我会说,‘哦,我忘记除以负一了,对!’”
显示更少 阅读更多
赞同
1
反对
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@valda313](https://www.youtube.com/@valda313)
好视频! 一个简单的问题:为什么我们只优化偏置而不优化权重?是为了简化这个例子吗?
显示更少 阅读更多
赞同
2
反对
回复
·
1 条回复
·
隐藏回复
·
1 条回复
[@cosmo266](https://www.youtube.com/@cosmo266)
你好……为什么你只使用旧导数乘以奖励来更新新的导数。从几何角度来看,这只是像缩放初始导数一样。通过引入偏差或其他类似的方法,我们可以获得更大的选择新值的范围。希望这能说得通。我还想问的是,这些奖励是固定的,我们能否让它们成为可学习的参数?
显示更少 阅读更多
赞同
反对
回复
·
3 条回复
·
隐藏回复
·
3 条回复