缩放定律
对应课程 Lecture 9, 11:Scaling laws(Tatsu)
在花几百万美元训练一个大模型之前,你怎么知道它值得?缩放定律(Scaling Laws) 是答案:模型损失随参数、数据、算力的增长遵循平滑、可预测的幂律。它让“先小规模实验、外推大规模结果”成为可能,是现代大模型工程的核心方法论。
Kaplan 定律:一切皆幂律
Kaplan 等(2020)在《Scaling Laws for Neural Language Models》中给出核心发现。固定测试集,语言模型的交叉熵损失可以写成:
其中
- 架构细节(深度 vs 宽度)对损失影响很小,性能主要由参数量决定;
- 模型越大,样本效率越高:大模型用更少的 token 达到同样的损失;
- 大规模训练不该用与孤立小模型相同的学习率:最优学习率随规模变大而下降。
经典计算公式:
Chinchilla:计算预算怎么分?
Kaplan 的结论是“在算力固定时,应该把大部分预算给模型参数”。Hoffmann 等(2022,《Training Compute-Optimal Large Language Models》,即 Chinchilla)重新审视,发现 Kaplan 的实验受限于“数据太少”(大模型在小数据上欠训练),修正了结论。
设总算力
其中
这就是著名的 “Chinchilla 比例”约 20:1。验证案例:Chinchilla 70B 训了 1.4T token,胜过训 300B token 的 Gopher 280B——同样的算力,更小的模型 + 更多数据 = 更好的模型。
三种实验方法(可移植的实验设计)
- 固定模型、变化数据:每条曲线对同一模型找最优数据量,拼接出
; - 等算力线上的最优配比:对每个预算
,扫多组 取损失最低点; - 参数化拟合:直接对
数据拟合上述带不可约项的三项公式,解析求最优。
实验设计的元教训
Chinchilla 的修正不是因为 Kaplan “算错了”,而是实验条件不同:外推要小心数据的适用范围。做缩放实验时,先确认你拟合的区域和你想外推的区域规律一致。
超越“计算最优”:推理成本与过训练
Chinchilla 最优是训练成本最优。但模型训完后要服务千万次推理,推理成本 ∝ 参数量。于是出现了“过训练(overtraining)”策略:
- 用远超 20:1 的 token/参数比训练较小模型(如 Llama 3 8B 训了 15T token,比率约 1900:1);
- 换来的是:训练多花点算力,推理模型小一个量级,总拥有成本(TCO)反而更低​;
- 部署导向的场景下,“计算最优”应改为“含推理的总成本最优”——这取决于预期推理量。
缩放定律的例外与坑
- 下游能力不总是平滑的:困惑度的幂律很好,但 MMLU 等下游任务的“涌现能力”呈阶梯状(部分源于指标不连续,如选择题的答对率);
- 数据质量改变常数:更好的数据整体下移损失曲线(改变
和系数),但不改变指数; - 架构变化(如 MoE)需要单独拟合:激活参数和总参数是两个不同的自变量;
- 重复数据会失效:数据重复太多时,
不再下降,幂律隐含假设数据近乎无限多样。
实操:小团队怎么用缩放定律
- 在 2~3 个小规模点训练,记录
; - 扣除不可约损失:先在高质量参考集上测一个“天花板”,或拟合三项公式;
- 对数坐标拟合直线,检查残差——不成直线说明模型设定错了​;
- 外推到目标规模,留出安全余量(1.2~2 倍算力);
- 用小模型的最优超参数随规模的变化规律(如学习率随
缩小)预测大模型配置,再小规模验证。
小结
- 损失随参数/数据呈平滑幂律,
;这让训练可预测、可规划。 - 计算最优的 token:参数比约 20:1(Chinchilla);推理导向时主动“过训练”小模型。
- 缩放定律是方法论而不只是公式:小规模实验 → 严格拟合 → 保守外推。