Lilian Weng·· 2026-06-24AI 评分58
Scaling Laws, Carefully:缩放律的实证回顾与拟合陷阱
Scaling Laws, Carefully
AI 导读
Lilian Weng 回顾了深度学习缩放律的演进:从早期学习曲线幂律,到 Kaplan 等(2020)提出大语言模型缩放律,再到 Chinchilla(Hoffmann 等 2022)重新论证计算最优分配,并讨论数据受限与重复数据下的修正方案。Kaplan 认为应更大模型、更少数据;Chinchilla 主张模型与数据等比例增长;后续工作进一步指出嵌入参数计数、数据重复和拟合方法会显著影响结论。
来源:Lilian Weng · lilianweng.github.io