Scaling Laws 为什么模型越大越聪明、为什么训练成本是天文数字
一句话概括
Scaling Laws(缩放定律):模型的"笨"程度(loss)会随着"参数量 N、数据量 D、算力 C"变大而可预测地下降,规律是幂律——所以大家拼命堆规模;但代价是算力呈乘积式爆炸增长。
为什么越大越聪明
- 容量更大:参数就像压缩包的容量,小模型只能记语法和常见搭配,大模型能塞下事实、逻辑、推理链条。
- 规律可预测:loss 随 N、D、C 的对数平滑下降,跨好几个数量级都没出现"天花板",只有边际收益递减。
- 涌现能力:规模突破某个临界点后,会冒出小模型完全没有的推理、翻译、写代码等能力。
- 前提是数据要跟上:Chinchilla 论文纠正了早期结论——N 和 D 要同步放大,只堆参数不喂够数据是纯浪费。
为什么成本是天文数字
核心公式:总算力 ≈ 6 × N × D
- 模型放大 10 倍 + 数据放大 10 倍 → 算力要 100 倍(乘积爆炸)
- 想让 loss 再降一点点,往往要 10 倍甚至 100 倍算力(幂律的边际递减)
叠加起来的现实成本:
| 因子 | 说明 |
|---|---|
| FLOPs | 顶级模型 10²⁴~10²⁵ 次浮点运算 |
| 硬件 | 数千到数万张 H100/B200,单卡数万美元 |
| 时间 | 上万卡并行也要跑数月 |
| 数据 | 采集、清洗、去重、标注都是重工程 |
| 失败重跑 | loss spike、硬件故障经常从头再来 |
| 通信瓶颈 | 卡间传输比卡内运算慢,浪费大量算力 |
| 人才 | 顶尖研究员和基础设施工程师薪资 |
行业现在的反思
纯堆规模的红利在放缓,新方向:
- 数据质量优先于数据数量
- MoE 稀疏模型:参数很多但每次只激活一小部分,绕开稠密训练的成本
- 长上下文、多模态、RLHF、后训练等新维度找增量
最通俗的比喻
- 越大越聪明 = 压缩包容量越大,能塞下越复杂的世界知识
- 成本爆炸 = 想让压缩包再精一点,容量和素材要一起翻倍,而算力是两者相乘,翻倍变四倍、十倍变百倍