Lilian Weng(@lilianweng)

A super long overdue (3+ years?) post on scaling laws. Compute is expensive. Scaling laws are a way...

8.5内容质量

TL;DR · AI 摘要

扩展定律是深度学习中最重要的实证发现之一,它帮助我们预测模型规模和数据量对训练损失的影响。

核心要点

  • 扩展定律表明,随着模型规模和数据量的增加,训练损失会以可预测的方式下降。
  • 计算资源昂贵,扩展定律有助于在大规模训练前优化计算分配。
  • Kaplan 等人和 Chinchilla 在扩展定律上的观点存在分歧,数据限制和拟合细节使外推变得复杂。

结构提纲

按章节快速跳转。

  1. 扩展定律是深度学习中最重要的实证发现之一,它帮助我们预测模型规模和数据量对训练损失的影响。

  2. 扩展定律表明,随着模型规模和数据量的增加,训练损失会以可预测的方式下降。

  3. 计算资源昂贵,扩展定律有助于在大规模训练前优化计算分配。

  4. Kaplan 等人和 Chinchilla 在扩展定律上的观点存在分歧,数据限制和拟合细节使外推变得复杂。

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • 扩展定律
    • 定义
      • 模型规模与训练损失的关系
    • 应用
      • 计算资源分配优化
    • 争议
      • Kaplan vs Chinchilla

金句 / Highlights

值得收藏与分享的关键句。

#深度学习#扩展定律#模型优化#计算资源
打开原文

Lilian Weng 在 X 上的发言:“关于扩展定律的超长待更新(3年以上?)帖子。计算成本高昂。扩展定律是一种帮助我们在投入大规模运行之前,合理分配计算资源在数据和模型规模之间的方法。这篇文章涵盖了扩展定律的预测内容,如何实现计算最优分配,为什么 Kaplan 等人和 Chinchilla 存在分歧,以及数据限制和拟合细节如何使外推变得复杂。” / X

Lilian Weng

@lilianweng

一篇关于扩展定律的超长待更新(3年以上?)帖子。计算成本高昂。扩展定律是一种帮助我们在投入大规模运行之前,合理分配计算资源在数据和模型规模之间的方法。这篇文章涵盖了扩展定律的预测内容,如何实现计算最优分配,为什么 Kaplan 等人和 Chinchilla 存在分歧,以及数据限制和拟合细节如何使外推变得复杂。

lilianweng.github.io/posts/2026-06-…

lilianweng.github.io

谨慎对待扩展定律

扩展定律是深度学习中最重要的实证发现之一。观察结果形式简单:随着模型规模 $N$ 和数据集的扩大,训练损失 $L$ 会可预测地减少。

2026年6月25日 下午8:06

45.6K

浏览量

1

8

18

4

141

.

K

1.1K

阅读18条回复