Skip to content

缩放定律

对应课程 Lecture 9, 11:Scaling laws(Tatsu)

在花几百万美元训练一个大模型之前,你怎么知道它值得?​缩放定律(Scaling Laws) 是答案:模型损失随参数、数据、算力的增长遵循平滑、可预测的幂律​。它让“先小规模实验、外推大规模结果”成为可能,是现代大模型工程的核心方法论。

Kaplan 定律:一切皆幂律

Kaplan 等(2020)在《Scaling Laws for Neural Language Models》中给出核心发现。固定测试集,语言模型的交叉熵损失可以写成:

L(N)(NcN)αN,L(D)(DcD)αD

其中 N 是参数量、D 是训练 token 数,指数 αN0.076αD0.095(对数坐标下是直线)。三点重要结论:

  1. 架构细节(深度 vs 宽度)对损失影响很小​,性能主要由参数量决定;
  2. 模型越大,样本效率越高​:大模型用更少的 token 达到同样的损失;
  3. 大规模训练不该用与孤立小模型相同的学习率​:最优学习率随规模变大而下降。

经典计算公式:N=12nlayerdmodel2(不含嵌入与偏置)。

Chinchilla:计算预算怎么分?

Kaplan 的结论是“在算力固定时,应该把大部分预算给模型参数”。Hoffmann 等(2022,《Training Compute-Optimal Large Language Models》,即 Chinchilla​)重新审视,发现 Kaplan 的实验受限于“数据太少”(大模型在小数据上欠训练),修正了结论。

设总算力 C6ND资源估算的公式),损失近似为:

L(N,D)=E+ANα+BDβ

其中 E 是不可约损失(irreducible loss,数据本身的熵,人力所不能及)。在 C 固定下最小化 L,最优配比满足:

DoptNopt1.35每增加一个参数,大约训练 20 个 token

这就是著名的 “Chinchilla 比例”约 20:1​。验证案例:Chinchilla 70B 训了 1.4T token,胜过训 300B token 的 Gopher 280B——同样的算力,更小的模型 + 更多数据 = 更好的模型​。

三种实验方法(可移植的实验设计)

  1. 固定模型、变化数据​:每条曲线对同一模型找最优数据量,拼接出 Nopt(C);
  2. 等算力线上的最优配比​:对每个预算 C,扫多组 (N,D) 取损失最低点;
  3. 参数化拟合​:直接对 (N,D,L) 数据拟合上述带不可约项的三项公式,解析求最优。

实验设计的元教训

Chinchilla 的修正不是因为 Kaplan “算错了”,而是实验条件不同​:外推要小心数据的适用范围。做缩放实验时,先确认你拟合的区域和你想外推的区域规律一致。

超越“计算最优”:推理成本与过训练

Chinchilla 最优是训练成本最优。但模型训完后要服务千万次推理,​推理成本 ∝ 参数量​。于是出现了“过训练(overtraining)”策略:

  • 用远超 20:1 的 token/参数比训练较小模型(如 Llama 3 8B 训了 15T token,比率约 1900:1);
  • 换来的是:训练多花点算力,​推理模型小一个量级,总拥有成本(TCO)反而更低​
  • 部署导向的场景下,“计算最优”应改为“含推理的总成本最优”——这取决于预期推理量。

缩放定律的例外与坑

  • 下游能力不总是平滑的​:困惑度的幂律很好,但 MMLU 等下游任务的“涌现能力”呈阶梯状(部分源于指标不连续,如选择题的答对率);
  • 数据质量改变常数​:更好的数据整体下移损失曲线(改变 E 和系数),但不改变指数;
  • 架构变化(如 MoE)需要单独拟合​:激活参数和总参数是两个不同的自变量;
  • 重复数据会失效​:数据重复太多时,L(D) 不再下降,幂律隐含假设数据近乎无限多样。

实操:小团队怎么用缩放定律

  1. 在 2~3 个小规模点训练,记录 (N,D,L);
  2. 扣除不可约损失:先在高质量参考集上测一个“天花板”,或拟合三项公式;
  3. 对数坐标拟合直线,检查残差——不成直线说明模型设定错了​
  4. 外推到目标规模,留出安全余量(1.2~2 倍算力);
  5. 用小模型的最优超参数随规模的变化规律​(如学习率随 dmodel 缩小)预测大模型配置,再小规模验证。

小结

  • 损失随参数/数据呈平滑幂律,L=E+A/Nα+B/Dβ;这让训练可预测、可规划。
  • 计算最优的 token:参数比约 20:1(Chinchilla);推理导向时主动“过训练”小模型。
  • 缩放定律是方法论而不只是公式:小规模实验 → 严格拟合 → 保守外推。
最近更新