跳转至

LLM 能力来源与 Scaling Law

面试高频考点

  • LLM 的能力到底从哪里来?
  • 参数量、数据量、计算量分别影响什么?
  • Scaling Law 是什么?为什么重要?
  • 涌现能力是不是玄学?
  • 为什么小模型也能通过蒸馏、RAG、工具调用变得有用?

外部图解:Scaling Law 曲线

Scaling Laws 原论文图:模型规模、数据和计算量与损失的幂律关系

图源:Scaling Laws for Neural Language Models。这张图适合解释为什么模型规模、数据规模和计算预算扩大时,loss 会呈现可预测的下降趋势。


一句话理解

LLM 的能力主要来自三件事:

大规模 next-token prediction 训练、足够大的模型容量、足够多且高质量的数据。

可以粗略拆成:

来源 作用
数据 提供知识、语言模式、任务示例
参数 存储和组合模式的容量
计算 让模型充分学习数据分布
架构 决定信息如何流动和扩展
对齐 让能力以人类可用的方式释放

1. Next-token prediction 为什么有效

细化理解: Next-token prediction 看起来只是语言建模,但在大规模数据上会把很多能力压进同一个目标里:要预测代码的下一个 token,就必须学会语法和局部执行模式;要预测数学推导,就必须学会中间步骤;要预测问答文本,就必须学会问题到答案的映射。它的优势是数据来源广、监督信号密集,每个 token 都是一个训练样本;限制是目标本身不区分真实、偏见、风格和安全,所以后训练与评估闭环仍然必要。

训练目标很简单:

给定前文 x_1, x_2, ..., x_t
预测下一个 token x_{t+1}

看起来只是补全,但要做好这件事,模型必须学会:

  • 语法和语义
  • 世界知识
  • 代码和数学模式
  • 对话格式
  • 推理链条
  • 文档结构
  • 任务说明和答案之间的映射

所以 next-token prediction 是一个非常密集的自监督信号。


2. 参数量:模型容量

参数可以理解为模型存储和组合模式的空间。

参数量增大通常带来:

  • 更强的表达能力
  • 更好的复杂模式拟合
  • 更强的上下文学习能力
  • 更稳定的多任务泛化

但参数不是越大越好。如果数据或计算不足,会出现欠训练。

参数大 + 数据不够 = 模型容量浪费
参数小 + 数据很多 = 表达能力受限

3. 数据量和数据质量

数据影响两件事:

  1. 模型知道什么
  2. 模型以什么风格表达

高质量数据包括:

  • 事实准确
  • 结构清晰
  • 多样性足够
  • 噪声少
  • 覆盖多语言、代码、数学、对话、长文档

低质量数据的问题:

  • 学到错误事实
  • 模板化
  • 重复污染
  • 评测集泄漏
  • 有害或偏见内容

现代训练越来越强调数据质量,而不只是 token 数。


4. 计算量:训练是否充分

训练计算量大致和下面三者相关:

训练 FLOPs ≈ 参数量 × token 数 × 常数

如果计算预算固定,就要在参数量和数据量之间做平衡。

Scaling Law 的核心意义是:

它告诉你在给定算力下,模型多大、数据多少更划算。


5. Scaling Law 是什么

细化理解: Scaling Law 关注的是参数量、数据量、计算量与 loss 之间的经验关系。它不能精确预言某个能力何时出现,但能指导训练预算怎么分配:参数太大但数据不够会欠训练,数据很多但模型太小会容量不足,算力预算固定时需要在模型规模和 token 数之间做平衡。面试里不要只说“大力出奇迹”,更要说 scaling 是资源配置方法,而不是无限堆参数。

Scaling Law 观察到:模型性能会随着参数量、数据量、计算量增加而按规律改善。

直觉:

更多参数 + 更多数据 + 更多计算
→ loss 下降
→ 下游能力提升

但收益是递减的。

所以商业训练不会盲目堆参数,而会问:

  • 这个算力预算下该训多大模型?
  • 数据 token 是否够?
  • 是否需要继续预训练?
  • 是否改用 MoE 提升参数效率?

6. 涌现能力怎么理解

涌现能力指模型规模到某个范围后,某些任务表现突然明显提升。

常见例子:

  • few-shot learning
  • chain-of-thought reasoning
  • 多步数学推理
  • 工具使用
  • 复杂指令遵循

不要把涌现讲成玄学。更稳的说法是:

当模型容量和训练数据足够大时,原本零散的模式可以被组合起来,表现为某些复杂任务能力突然可用。


7. 对齐如何释放能力

细化理解: 对齐通常不负责注入大量新知识,而是把预训练模型中已经具备的能力调整成用户可用的行为。SFT 让模型学会指令格式和回答风格,偏好优化让模型更倾向于人类认为有帮助、安全、清晰的输出。对齐也可能带来副作用,例如过度拒答、答案变模板化、创造性下降,所以需要在 helpfulness、harmlessness、honesty 之间评估权衡。

预训练模型更像“文本续写器”,不一定像助手。

SFT / RLHF / DPO 的作用是:

  • 让模型理解指令格式
  • 学会拒答和安全边界
  • 优化帮助性和表达方式
  • 让输出更符合人类偏好

所以面试里可以说:

预训练提供能力,对齐决定能力如何被调用和呈现。


8. 小模型为什么也有价值

小模型能力弱一些,但有优势:

  • 成本低
  • 延迟低
  • 易部署
  • 可私有化
  • 适合专门任务

增强方式:

方法 作用
RAG 补外部知识
SFT 改任务行为
DPO 改偏好风格
蒸馏 从强模型学能力
工具调用 把计算交给外部系统
Agent Workflow 用流程弥补单模型不足

商业项目里经常不是直接上最大模型,而是组合小模型、检索、工具和评估。


常见误区

误区 1:能力都来自参数量

不对。数据质量、训练 token、对齐方式、推理策略都重要。

误区 2:Scaling Law 只对训练大模型有用

不对。它也帮助你理解为什么小数据微调不能凭空制造大量新知识。

误区 3:涌现能力完全不可解释

不是完全不可解释。它通常和规模、数据覆盖、任务度量方式有关。

误区 4:对齐会让模型更懂知识

对齐主要改变行为和偏好,不是补充大量新知识。


面试延伸

Q:为什么预训练模型已经有能力,还要 SFT?

预训练学到的是续写分布,不一定知道如何按人类指令稳定回答。SFT 把能力包装成可用的助手接口。

Q:继续预训练和 SFT 怎么选?

缺领域知识时做继续预训练;知道但不会按格式完成任务时做 SFT;回答风格和偏好不符合预期时做 DPO/RLHF。

Q:为什么 RAG 能让小模型在企业场景有用?

因为企业问答很多问题的难点不是推理,而是拿到正确私有知识。RAG 把知识从参数里移到检索系统里,降低了模型本体要求。


原始论文

论文 链接
Scaling Laws for Neural Language Models (Kaplan et al., 2020) arxiv.org/abs/2001.08361
Training Compute-Optimal Large Language Models / Chinchilla (Hoffmann et al., 2022) arxiv.org/abs/2203.15556
Emergent Abilities of Large Language Models (Wei et al., 2022) arxiv.org/abs/2206.07682
Are Emergent Abilities of Large Language Models a Mirage? (Schaeffer et al., 2023) arxiv.org/abs/2304.15004
A Survey of Large Language Models (Zhao et al., 2023) arxiv.org/abs/2303.18223

延伸阅读与视频

平台 标题 说明
📖 OpenAI / Paper Scaling Laws for Neural Language Models 理解参数、数据、计算与 loss 的幂律关系
📖 DeepMind / Paper Chinchilla: Training Compute-Optimal LLMs 理解为什么“更多 token + 合适参数量”比单纯堆参数重要
📺 YouTube 李沐论文精读:Scaling Law / Chinchilla 中文论文精读入口,可配合原文看
📖 Hugging Face Papers Emergent Abilities of LLMs 快速查看涌现能力论文和相关模型讨论
📺 Course Stanford CS336: Language Modeling from Scratch 系统学习预训练、scaling、数据和评估
📖 OpenAI Blog Scaling Laws for Neural Language Models OpenAI 官方 scaling law 背景文章
📖 DeepMind Blog Compute-optimal LLM training Chinchilla 官方解读