T
traeai
登录
返回首页
StatQuest视频

Reinforcement Learning with Neural Networks: Mathematical Details

7.5内容质量
可直接观看的视频资源打开原视频

TL;DR · AI 摘要

本文详细探讨了神经网络在强化学习中的数学细节,包括价值函数、策略梯度等内容。

核心要点

  • 理解价值函数和策略梯度在强化学习中的作用。
  • 掌握神经网络如何应用于强化学习。
  • 了解强化学习中的数学基础。

结构提纲

按章节快速跳转。

  1. 介绍强化学习的基本概念及其应用。

  2. 详细解释了价值函数的概念及其在强化学习中的重要性。

  3. 深入探讨了策略梯度的方法及其在神经网络中的实现。

  4. 展示了如何将神经网络应用于强化学习的具体实例。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 强化学习中的数学细节

金句 / Highlights

值得收藏与分享的关键句。

#强化学习#神经网络#机器学习

视频笔记

强化学习与神经网络:数学细节 - YouTube

返回 ![图像 1](https://www.youtube.com/ "YouTube 主页")

跳过导航

搜索

用声音搜索

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

登录

![图像 2](https://www.youtube.com/ "YouTube 主页")

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

强化学习与神经网络:数学细节

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

轻触取消静音

2倍速

图像 3
图像 3

强化学习与神经网络:数学细节

StatQuest with Josh Starmer 29,839 观看次数 1年前

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

搜索

复制链接

信息

购物

图像 4
图像 4
图像 5
图像 5

如果播放很快没有开始,请尝试重启设备。

您已退出登录

您观看的视频可能会被添加到电视的观看历史中,并影响电视推荐。为了避免这种情况,请取消并登录到您的电脑上的 YouTube。

取消 确认

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

分享

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ "分享链接")- [x] 包含播放列表

检索共享信息时发生错误。请稍后再试。

图像 6
图像 6

0:00

[](https://www.youtube.com/watch?v=DVGmsnxB2UQ)[](https://www.youtube.com/watch?v=KphmOJnLAdI "下一个 (SHIFT+n)")

0:00 / 0:00

直播

•完整观看视频

超赞的歌曲和介绍

24:00 强化学习与神经网络:基本概念 StatQuest with Josh Starmer 50K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)59:36 政策梯度定理解释 - 强化学习 Elliot Waite 83K 观看次数 • 5年前 直播 播放列表 ()混合 (50+)23:01 什么是卷积?3Blue1Brown 3.5M 观看次数 • 3年前 直播 播放列表 ()混合 (50+)18:13 强化学习:基本概念 StatQuest with Josh Starmer 94K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)56:51 图灵奖得主:不同意谷歌、Postgres、未来问题 | Mike Stonebraker Ryan Peterman 279K 观看次数 • 2周前 直播 播放列表 ()混合 (50+)33:25 我从未想象过的灾难 Veritasium 5.4M 观看次数 • 10天前 直播 播放列表 ()混合 (50+)26:03 强化学习:机器学习与控制理论 Steve Brunton 382K 观看次数 • 5年前 直播 播放列表 ()混合 (50+)37:25 Yann LeCun 的10亿美元赌注反对LLMs Welch Labs 382K 观看次数 • 8天前 直播 播放列表 ()混合 (50+)23:43 变换器神经网络背后的矩阵数学,一步一步讲解!!!StatQuest with Josh Starmer 89K 观看次数 • 2年前 直播 播放列表 ()混合 (50+)18:02 带有人类反馈的强化学习 (RLHF),清晰解释!!!StatQuest with Josh Starmer 57K 观看次数 • 1年前 直播 播放列表 ()混合 (50+)40:08 机器学习中最重要算法 Artem Kirsanov 1M 观看次数 • 2年前 直播 播放列表 ()混合 (50+)16:27 强化学习简介 Arxiv Insights 708K 观看次数 • 8年前 直播 播放列表 ()混合 (50+)

1倍速

登录以确认您不是机器人 这有助于保护我们的社区。 了解更多

登录

强化学习与神经网络:数学细节

图像 7: StatQuest with Josh Starmer
图像 7: StatQuest with Josh Starmer

StatQuest with Josh Starmer

StatQuest with Josh Starmer

1.63M 订阅者

加入

订阅

已订阅

748

分享

29K 观看次数 1年前 #StatQuest

29,839 观看次数 • 2025年4月13日 #StatQuest

我们逐步讲解了使用强化学习更新神经网络参数所需的数学知识。我们展示了如何计算导数(BAM!),然后更新它们(DOUBLE BAM!!),最后用于优化参数(TRIPLE BAM!!!)。……更多

……更多

章节

查看全部

![图像 8 #### 超赞的歌曲和介绍 #### 超赞的歌曲和介绍 0:00](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

#### Awesome song and introduction

0:00

![Image 9 #### 计算导数 #### 计算导数 4:09](https://www.youtube.com/watch?v=DVGmsnxB2UQ&t=249s)

#### 计算导数

4:09

![Image 10 #### 使用奖励更新导数 #### 使用奖励更新导数 12:16](https://www.youtube.com/watch?v=DVGmsnxB2UQ&t=736s)

#### 使用奖励更新导数

12:16

![Image 11 #### 更新神经网络中的参数 #### 更新神经网络中的参数 15:39](https://www.youtube.com/watch?v=DVGmsnxB2UQ&t=939s)

#### 更新神经网络中的参数

15:39

![Image 12 #### 第二个示例 #### 第二个示例 16:28](https://www.youtube.com/watch?v=DVGmsnxB2UQ&t=988s)

#### 第二个示例

16:28

Transcript

跟随字幕进行学习。

显示字幕

![Image 13 ### StatQuest with Josh Starmer 1.63M subscribers](https://www.youtube.com/@statquest)

视频关于![Image 14 Patreon](https://www.youtube.com/redirect?event=Watch_SD_EP&redir_token=QUFFLUhqbkhYTGhtSFdHalVHZkpxTkZGaFE0a01VcWRXZ3xBQ3Jtc0treTJja3RDVXNPVlVDcnNJdmdCQjduTmdJLWNYQVFlR1RBcVBfZWRvanZwLUlfdHJmdnFuenpqQi1qZ1QtUlZ1MlU0WDQwX3pPN3FDdFRsTDNkbC1Ib2dHTThwd1JwNWhRb3g4RGVWWDhGMk90TjUxVQ&q=https%3A%2F%2Fwww.patreon.com%2Fstatquest)

![Image 15: true 18:13 18:13](https://www.youtube.com/watch?v=Z-T0iJEXiwM)强化学习:StatQuest 中的核心概念由 Josh Starmer 解释

![Image 16 StatQuest 商店 - StatQuest!!! 购买书籍!](https://www.youtube.com/redirect?event=infocard&redir_token=QUFFLUhqbE1lMUlfZmYtZFNyUFlBQ3Q3UG41TnpVWEM4d3xBQ3Jtc0ttaDA5U3FPNVg3NGxvMFpLeHQ5N0xOVF9nSHRNdTJDYWhSWWJ4SWUwMmlUOGJON3pHdkdOV3Q4SjlWUmZEb1dXcnpPOXFKWTU3U2R0cWlFS0dDQXFxYUxIR1hXRjV2bkxMU2dldHlqdXhMZjJJRFNDNA&q=https%3A%2F%2Fstatquest.org%2Fstatquest-store%2F)

![Image 17 StatQuest 商店 - StatQuest!!! 购买书籍!](https://www.youtube.com/redirect?event=infocard&redir_token=QUFFLUhqbE1lMUlfZmYtZFNyUFlBQ3Q3UG41TnpVWEM4d3xBQ3Jtc0ttaDA5U3FPNVg3NGxvMFpLeHQ5N0xOVF9nSHRNdTJDYWhSWWJ4SWUwMmlUOGJON3pHdkdOV3Q4SjlWUmZEb1dXcnpPOXFKWTU3U2R0cWlFS0dDQXFxYUxIR1hXRjV2bkxMU2dldHlqdXhMZjJJRFNDNA&q=https%3A%2F%2Fstatquest.org%2Fstatquest-store%2F)

显示更少

[](https://www.youtube.com/hashtag/statquest)#StatQuest

强化学习与神经网络:数学细节

29,839 视频观看次数

29K 视频观看次数

2025年4月13日

748

分享

保存

下载

下载

浏览 StatQuest with Josh Starmer 商店

![Image 18 StatQuest Triple BAM Logo - 男士优质T恤 $26.99 Spreadshop 经典剪裁男式T恤,100%棉(深灰色和冰蓝色为95%棉/5%粘胶)。品牌:SPREAD Shop Spreadshop](https://www.youtube.com/watch?v=DVGmsnxB2UQ)![Image 19 Statquest logo color - 咖啡/茶杯 $16.99 Spreadshop 100%陶瓷杯用于饮用。品牌:BestSub Shop Spreadshop](https://www.youtube.com/watch?v=DVGmsnxB2UQ)![Image 20 Norm N 'Squatch!!! - 男士优质T恤 $26.99 Spreadshop 经典剪裁男式T恤,100%棉(深灰色和冰蓝色为95%棉/5%粘胶)。品牌:SPREAD Shop Spreadshop](https://www.youtube.com/watch?v=DVGmsnxB2UQ)![Image 21 StatQuest Triple BAM Logo - 女士优质T恤 $26.99 Spreadshop 适合女性的经典剪裁T恤 | 品牌:SPREAD | 100%棉。浏览 Spreadshop](https://www.youtube.com/watch?v=DVGmsnxB2UQ)

68 条评论

排序评论

热门 显示特色评论最新 显示最近的评论,包括潜在垃圾信息

Image 22: 默认头像照片
Image 22: 默认头像照片

添加一条评论...

Image 23
Image 23

@statquest 置顶

[@statquest](https://www.youtube.com/@statquest)

@statquest @statquest1年前

通过购买我的书籍《StatQuest机器学习图解指南》、《StatQuest神经网络和AI图解指南》或学习指南和商品来支持StatQuest!!! https://statquest.org/statquest-store/

显示更少 阅读更多

喜欢

5

不喜欢

回复

[@UnconditionalBeta](https://www.youtube.com/@UnconditionalBeta)

4个月前

“链式法则”——每次听到这个词我都会笑。没想到学习这些复杂的东西会这么有趣!

显示较少 阅读更多

喜欢

不喜欢

Image 25
Image 25

❤ 来自 @statquest

回复

Image 26
Image 26

·

1 回复

Image 27
Image 27

·

隐藏回复

Image 28: StatQuest with Josh Starmer
Image 28: StatQuest with Josh Starmer

·

1 回复

Image 29
Image 29

[@william_8844](https://www.youtube.com/@william_8844)

1年前

终于等到了这个!😄

显示较少 阅读更多

喜欢

不喜欢

回复

Image 31
Image 31

·

1 回复

Image 32
Image 32

·

隐藏回复

Image 33: StatQuest with Josh Starmer
Image 33: StatQuest with Josh Starmer

·

1 回复

Image 34
Image 34

[@radhikab4864](https://www.youtube.com/@radhikab4864)

1年前

Josh,你太棒了!

显示较少 阅读更多

喜欢

不喜欢

回复

Image 35
Image 35

·

1 回复

Image 36
Image 36

·

隐藏回复

Image 37: StatQuest with Josh Starmer
Image 37: StatQuest with Josh Starmer

·

1 回复

Image 38
Image 38

[@Uniquekeyz](https://www.youtube.com/@Uniquekeyz)

1年前

Josh Starmer,你绝对是最好的,我喜欢你的视频,我爱这个频道 ❤

显示较少 阅读更多

喜欢

不喜欢

回复

Image 39
Image 39

·

1 回复

Image 40
Image 40

·

隐藏回复

Image 41
Image 41

·

1 回复

Image 42
Image 42

[@iqra2291](https://www.youtube.com/@iqra2291)

1年前

我一直期待着这个 ❤🎉

显示较少 阅读更多

喜欢

不喜欢

Image 43
Image 43

❤ 来自 @statquest

回复

Image 44
Image 44

·

2 回复

Image 45
Image 45

·

隐藏回复

Image 46
Image 46

·

2 回复

Image 47
Image 47

[@Vibe-Math](https://www.youtube.com/@Vibe-Math)

1年前

谢谢您,先生!

显示较少 阅读更多

喜欢

不喜欢

回复

Image 48
Image 48

·

1 回复

Image 49
Image 49

·

隐藏回复

Image 50
Image 50

·

1 回复

Image 51
Image 51

[@alihaghighat1244](https://www.youtube.com/@alihaghighat1244)

1年前

嗨,Josh!我从您的内容中做了笔记。感谢您简化了复杂的强化学习概念。😊

显示较少 阅读更多

喜欢

不喜欢

Image 52
Image 52

❤ 来自 @statquest

回复

Image 53
Image 53

·

2 回复

Image 54
Image 54

·

隐藏回复

Image 55
Image 55

[@pashamorozov8257](https://www.youtube.com/@pashamorozov8257)

1年前

哇!感谢强化学习!

显示较少 阅读更多

喜欢

不喜欢

回复

Image 56
Image 56

·

1 回复

Image 57
Image 57

·

隐藏回复

Image 58
Image 58

[@neelkamal3357](https://www.youtube.com/@neelkamal3357)

1年前

数学棒极了!!!

显示较少 阅读更多

喜欢

不喜欢

回复

Image 59
Image 59

·

1 回复

Image 60
Image 60

·

隐藏回复

Image 68
Image 68

[@k10shetty](https://www.youtube.com/@k10shetty)

4 个月前

在强化学习中,我们总是假设所选动作是正确的来计算损失。总是猜测我们采取的动作是正确的。

显示更少 阅读更多

赞同

2

反对

回复

Image 69
Image 69

·

1 条回复

Image 70
Image 70

·

隐藏回复

Image 71
Image 71

·

1 条回复

Image 72
Image 72

[@ertugruluyar.social](https://www.youtube.com/@ertugruluyar.social)

1 年前

你好,感谢精彩的视频。你能做一个播放列表来涵盖层次线性模型(混合模型)吗?

显示更少 阅读更多

赞同

反对

回复

Image 73
Image 73

·

1 条回复

Image 74
Image 74

·

隐藏回复

Image 75
Image 75

·

1 条回复

Image 76
Image 76

[@planecrazy242](https://www.youtube.com/@planecrazy242)

1 年前

这让我头疼!Image 77: 🤯

显示更少 阅读更多

赞同

1

反对

回复

Image 78
Image 78

·

1 条回复

Image 79
Image 79

·

隐藏回复

Image 80
Image 80

·

1 条回复

Image 81
Image 81

[@jauharulumam1683](https://www.youtube.com/@jauharulumam1683)

1 年前

你好,Josh。来自印尼。

显示更少 阅读更多

赞同

1

反对

回复

Image 82
Image 82

·

1 条回复

Image 83
Image 83

·

隐藏回复

Image 84
Image 84

·

1 条回复

Image 85
Image 85

[@festashabani20](https://www.youtube.com/@festashabani20)

10 个月前

嘿,Josh,感谢你精彩的视频!问题:你用什么工具制作这些幻灯片和图表等等?

显示更少 阅读更多

赞同

1

反对

回复

Image 86
Image 86

·

1 条回复

Image 87
Image 87

·

隐藏回复

Image 88
Image 88

·

1 条回复

Image 89
Image 89

[@mbeugelisall](https://www.youtube.com/@mbeugelisall)

1 年前

如果没有你的视频,我不认为我能赢得奖学金或在喷气推进实验室的实习机会。我向你保证我的第一个孩子。

显示更少 阅读更多

赞同

27

反对

Image 90
Image 90

❤ 由 @statquest

回复

Image 91
Image 91

·

2 条回复

Image 92
Image 92

·

隐藏回复

Image 93
Image 93

·

2 条回复

Image 94
Image 94

[@gsestream](https://www.youtube.com/@gsestream)

1 年前

二进制多变量PCA应该很有趣。每个轴只有0或1,而不是任意浮点值。用于二进制神经网络的梯度下降。

显示更少 阅读更多

赞同

反对

回复

Image 95
Image 95

[@eliasboulham](https://www.youtube.com/@eliasboulham)

1 年前

“如果他们说,‘再试一次,别忘了乘以负一’,那么我会使用第一次试验得到的不平衡骰子重新猜测。如果我犯了错误,我会说,‘哦,我忘记除以负一了,对!’”

显示更少 阅读更多

赞同

1

反对

回复

Image 96
Image 96

·

1 条回复

Image 97
Image 97

·

隐藏回复

Image 98
Image 98

·

1 条回复

Image 99
Image 99

[@valda313](https://www.youtube.com/@valda313)

1 年前

好视频!Image 100: 👍🏻 一个简单的问题:为什么我们只优化偏置而不优化权重?是为了简化这个例子吗?

显示更少 阅读更多

赞同

2

反对

回复

Image 101
Image 101

·

1 条回复

Image 102
Image 102

·

隐藏回复

Image 103
Image 103

·

1 条回复

Image 104
Image 104

[@cosmo266](https://www.youtube.com/@cosmo266)

11 个月前

你好……为什么你只使用旧导数乘以奖励来更新新的导数。从几何角度来看,这只是像缩放初始导数一样。通过引入偏差或其他类似的方法,我们可以获得更大的选择新值的范围。希望这能说得通。我还想问的是,这些奖励是固定的,我们能否让它们成为可学习的参数?

显示更少 阅读更多

赞同

反对

回复

图像 105
图像 105

·

3 条回复

图像 106
图像 106

·

隐藏回复

图像 107
图像 107

·

3 条回复

AI 可能会生成不准确的信息,请核实重要内容