Backpropagation Explained for Beginners (Part 1): Building the Intuition
反向传播是神经网络训练的核心机制,通过梯度下降优化参数。本文以直观方式拆解其数学原理,适合深度学习入门者。
入选理由:反向传播通过链式法则计算梯度,优化模型参数
概念
别名:Rectified Linear Unit
常用激活函数,引入非线性特性
已跟踪 3 条高相关材料
最近变化
2026-07-19 · 反向传播通过链式法则计算梯度,优化模型参数
为什么值得关注
ReLU 被反复提及时,通常意味着它正在影响产品路线、开发者工作流或 AI 产业判断。这个页面把分散材料合并成一个可持续更新的观察入口。
Backpropagation Explained for Beginners (Part 1): Building the Intuition
Towards Data Science · 8.5 分
反向传播是神经网络训练的核心机制,通过梯度下降优化参数。本文以直观方式拆解其数学原理,适合深度学习入门者。
MoE环游记:9、门控归一化之争
科学空间 · 8.5 分
本文探讨了MoE模型中Gate激活函数的选择及其归一化方式,分析了Softmax、Sigmoid等不同方法的优劣。
Sequential Fitting: A Different Perspective on the Spectral Bias of Neural Networks
Towards Data Science · 8.5 分
神经网络在拟合高频率函数时存在“频谱偏差”,即优先拟合低频部分,导致训练效率低下。本文从不同角度分析了这一现象,并提出了解释。
已收录 3 条与 ReLU 相关的内容,按评分排序。
反向传播是神经网络训练的核心机制,通过梯度下降优化参数。本文以直观方式拆解其数学原理,适合深度学习入门者。
入选理由:反向传播通过链式法则计算梯度,优化模型参数
本文探讨了MoE模型中Gate激活函数的选择及其归一化方式,分析了Softmax、Sigmoid等不同方法的优劣。
入选理由:DeepSeek使用Sigmoid激活函数实现Loss-Free负载均衡,效果显著。
神经网络在拟合高频率函数时存在“频谱偏差”,即优先拟合低频部分,导致训练效率低下。本文从不同角度分析了这一现象,并提出了解释。
入选理由:神经网络在拟合高频率函数时需要更多训练轮次,导致效率低下。