Lilian Weng(@lilianweng)
A super long overdue (3+ years?) post on scaling laws. Compute is expensive. Scaling laws are a way...
8.5内容质量
TL;DR · AI 摘要
扩展定律是深度学习中最重要的实证发现之一,它帮助我们预测模型规模和数据量对训练损失的影响。
核心要点
- 扩展定律表明,随着模型规模和数据量的增加,训练损失会以可预测的方式下降。
- 计算资源昂贵,扩展定律有助于在大规模训练前优化计算分配。
- Kaplan 等人和 Chinchilla 在扩展定律上的观点存在分歧,数据限制和拟合细节使外推变得复杂。
结构提纲
按章节快速跳转。
- §引言
扩展定律是深度学习中最重要的实证发现之一,它帮助我们预测模型规模和数据量对训练损失的影响。
扩展定律表明,随着模型规模和数据量的增加,训练损失会以可预测的方式下降。
计算资源昂贵,扩展定律有助于在大规模训练前优化计算分配。
Kaplan 等人和 Chinchilla 在扩展定律上的观点存在分歧,数据限制和拟合细节使外推变得复杂。
思维导图
用一张图看清主题之间的关系。
查看大纲文本(无障碍 / 无 JS 友好)
- 扩展定律
- 定义
- 模型规模与训练损失的关系
- 应用
- 计算资源分配优化
- 争议
- Kaplan vs Chinchilla
金句 / Highlights
值得收藏与分享的关键句。
扩展定律是深度学习中最重要的实证发现之一。
随着模型规模和数据量的增加,训练损失会以可预测的方式下降。
Kaplan 等人和 Chinchilla 在扩展定律上的观点存在分歧。
#深度学习#扩展定律#模型优化#计算资源
打开原文Lilian Weng 在 X 上的发言:“关于扩展定律的超长待更新(3年以上?)帖子。计算成本高昂。扩展定律是一种帮助我们在投入大规模运行之前,合理分配计算资源在数据和模型规模之间的方法。这篇文章涵盖了扩展定律的预测内容,如何实现计算最优分配,为什么 Kaplan 等人和 Chinchilla 存在分歧,以及数据限制和拟合细节如何使外推变得复杂。” / X
@lilianweng
一篇关于扩展定律的超长待更新(3年以上?)帖子。计算成本高昂。扩展定律是一种帮助我们在投入大规模运行之前,合理分配计算资源在数据和模型规模之间的方法。这篇文章涵盖了扩展定律的预测内容,如何实现计算最优分配,为什么 Kaplan 等人和 Chinchilla 存在分歧,以及数据限制和拟合细节如何使外推变得复杂。
lilianweng.github.io/posts/2026-06-…
lilianweng.github.io
谨慎对待扩展定律
扩展定律是深度学习中最重要的实证发现之一。观察结果形式简单:随着模型规模 $N$ 和数据集的扩大,训练损失 $L$ 会可预测地减少。
2026年6月25日 下午8:06
45.6K
浏览量
1
8
18
4
141
.
K
1.1K
阅读18条回复