LLM 能力来源与 Scaling Law¶
面试高频考点¶
- LLM 的能力到底从哪里来?
- 参数量、数据量、计算量分别影响什么?
- Scaling Law 是什么?为什么重要?
- 涌现能力是不是玄学?
- 为什么小模型也能通过蒸馏、RAG、工具调用变得有用?
外部图解:Scaling Law 曲线¶

图源:Scaling Laws for Neural Language Models。这张图适合解释为什么模型规模、数据规模和计算预算扩大时,loss 会呈现可预测的下降趋势。
一句话理解¶
LLM 的能力主要来自三件事:
大规模 next-token prediction 训练、足够大的模型容量、足够多且高质量的数据。
可以粗略拆成:
| 来源 | 作用 |
|---|---|
| 数据 | 提供知识、语言模式、任务示例 |
| 参数 | 存储和组合模式的容量 |
| 计算 | 让模型充分学习数据分布 |
| 架构 | 决定信息如何流动和扩展 |
| 对齐 | 让能力以人类可用的方式释放 |
1. Next-token prediction 为什么有效¶
细化理解: Next-token prediction 看起来只是语言建模,但在大规模数据上会把很多能力压进同一个目标里:要预测代码的下一个 token,就必须学会语法和局部执行模式;要预测数学推导,就必须学会中间步骤;要预测问答文本,就必须学会问题到答案的映射。它的优势是数据来源广、监督信号密集,每个 token 都是一个训练样本;限制是目标本身不区分真实、偏见、风格和安全,所以后训练与评估闭环仍然必要。
训练目标很简单:
给定前文 x_1, x_2, ..., x_t
预测下一个 token x_{t+1}
看起来只是补全,但要做好这件事,模型必须学会:
- 语法和语义
- 世界知识
- 代码和数学模式
- 对话格式
- 推理链条
- 文档结构
- 任务说明和答案之间的映射
所以 next-token prediction 是一个非常密集的自监督信号。
2. 参数量:模型容量¶
参数可以理解为模型存储和组合模式的空间。
参数量增大通常带来:
- 更强的表达能力
- 更好的复杂模式拟合
- 更强的上下文学习能力
- 更稳定的多任务泛化
但参数不是越大越好。如果数据或计算不足,会出现欠训练。
参数大 + 数据不够 = 模型容量浪费
参数小 + 数据很多 = 表达能力受限
3. 数据量和数据质量¶
数据影响两件事:
- 模型知道什么
- 模型以什么风格表达
高质量数据包括:
- 事实准确
- 结构清晰
- 多样性足够
- 噪声少
- 覆盖多语言、代码、数学、对话、长文档
低质量数据的问题:
- 学到错误事实
- 模板化
- 重复污染
- 评测集泄漏
- 有害或偏见内容
现代训练越来越强调数据质量,而不只是 token 数。
4. 计算量:训练是否充分¶
训练计算量大致和下面三者相关:
训练 FLOPs ≈ 参数量 × token 数 × 常数
如果计算预算固定,就要在参数量和数据量之间做平衡。
Scaling Law 的核心意义是:
它告诉你在给定算力下,模型多大、数据多少更划算。
5. Scaling Law 是什么¶
细化理解: Scaling Law 关注的是参数量、数据量、计算量与 loss 之间的经验关系。它不能精确预言某个能力何时出现,但能指导训练预算怎么分配:参数太大但数据不够会欠训练,数据很多但模型太小会容量不足,算力预算固定时需要在模型规模和 token 数之间做平衡。面试里不要只说“大力出奇迹”,更要说 scaling 是资源配置方法,而不是无限堆参数。
Scaling Law 观察到:模型性能会随着参数量、数据量、计算量增加而按规律改善。
直觉:
更多参数 + 更多数据 + 更多计算
→ loss 下降
→ 下游能力提升
但收益是递减的。
所以商业训练不会盲目堆参数,而会问:
- 这个算力预算下该训多大模型?
- 数据 token 是否够?
- 是否需要继续预训练?
- 是否改用 MoE 提升参数效率?
6. 涌现能力怎么理解¶
涌现能力指模型规模到某个范围后,某些任务表现突然明显提升。
常见例子:
- few-shot learning
- chain-of-thought reasoning
- 多步数学推理
- 工具使用
- 复杂指令遵循
不要把涌现讲成玄学。更稳的说法是:
当模型容量和训练数据足够大时,原本零散的模式可以被组合起来,表现为某些复杂任务能力突然可用。
7. 对齐如何释放能力¶
细化理解: 对齐通常不负责注入大量新知识,而是把预训练模型中已经具备的能力调整成用户可用的行为。SFT 让模型学会指令格式和回答风格,偏好优化让模型更倾向于人类认为有帮助、安全、清晰的输出。对齐也可能带来副作用,例如过度拒答、答案变模板化、创造性下降,所以需要在 helpfulness、harmlessness、honesty 之间评估权衡。
预训练模型更像“文本续写器”,不一定像助手。
SFT / RLHF / DPO 的作用是:
- 让模型理解指令格式
- 学会拒答和安全边界
- 优化帮助性和表达方式
- 让输出更符合人类偏好
所以面试里可以说:
预训练提供能力,对齐决定能力如何被调用和呈现。
8. 小模型为什么也有价值¶
小模型能力弱一些,但有优势:
- 成本低
- 延迟低
- 易部署
- 可私有化
- 适合专门任务
增强方式:
| 方法 | 作用 |
|---|---|
| RAG | 补外部知识 |
| SFT | 改任务行为 |
| DPO | 改偏好风格 |
| 蒸馏 | 从强模型学能力 |
| 工具调用 | 把计算交给外部系统 |
| Agent Workflow | 用流程弥补单模型不足 |
商业项目里经常不是直接上最大模型,而是组合小模型、检索、工具和评估。
常见误区¶
误区 1:能力都来自参数量¶
不对。数据质量、训练 token、对齐方式、推理策略都重要。
误区 2:Scaling Law 只对训练大模型有用¶
不对。它也帮助你理解为什么小数据微调不能凭空制造大量新知识。
误区 3:涌现能力完全不可解释¶
不是完全不可解释。它通常和规模、数据覆盖、任务度量方式有关。
误区 4:对齐会让模型更懂知识¶
对齐主要改变行为和偏好,不是补充大量新知识。
面试延伸¶
Q:为什么预训练模型已经有能力,还要 SFT?
预训练学到的是续写分布,不一定知道如何按人类指令稳定回答。SFT 把能力包装成可用的助手接口。
Q:继续预训练和 SFT 怎么选?
缺领域知识时做继续预训练;知道但不会按格式完成任务时做 SFT;回答风格和偏好不符合预期时做 DPO/RLHF。
Q:为什么 RAG 能让小模型在企业场景有用?
因为企业问答很多问题的难点不是推理,而是拿到正确私有知识。RAG 把知识从参数里移到检索系统里,降低了模型本体要求。
原始论文¶
| 论文 | 链接 |
|---|---|
| Scaling Laws for Neural Language Models (Kaplan et al., 2020) | arxiv.org/abs/2001.08361 |
| Training Compute-Optimal Large Language Models / Chinchilla (Hoffmann et al., 2022) | arxiv.org/abs/2203.15556 |
| Emergent Abilities of Large Language Models (Wei et al., 2022) | arxiv.org/abs/2206.07682 |
| Are Emergent Abilities of Large Language Models a Mirage? (Schaeffer et al., 2023) | arxiv.org/abs/2304.15004 |
| A Survey of Large Language Models (Zhao et al., 2023) | arxiv.org/abs/2303.18223 |
延伸阅读与视频¶
| 平台 | 标题 | 说明 |
|---|---|---|
| 📖 OpenAI / Paper | Scaling Laws for Neural Language Models | 理解参数、数据、计算与 loss 的幂律关系 |
| 📖 DeepMind / Paper | Chinchilla: Training Compute-Optimal LLMs | 理解为什么“更多 token + 合适参数量”比单纯堆参数重要 |
| 📺 YouTube | 李沐论文精读:Scaling Law / Chinchilla | 中文论文精读入口,可配合原文看 |
| 📖 Hugging Face Papers | Emergent Abilities of LLMs | 快速查看涌现能力论文和相关模型讨论 |
| 📺 Course | Stanford CS336: Language Modeling from Scratch | 系统学习预训练、scaling、数据和评估 |
| 📖 OpenAI Blog | Scaling Laws for Neural Language Models | OpenAI 官方 scaling law 背景文章 |
| 📖 DeepMind Blog | Compute-optimal LLM training | Chinchilla 官方解读 |