2025 前沿对齐技术(RLVR / DAPO / RLAIF / OpenRLHF / veRL)¶
面试高频考点¶
- RLVR 和 RLHF 的核心区别是什么?为什么适合推理模型训练?
- DAPO 解决了 GRPO 的什么问题?Clip-Higher 策略是什么?
- OpenRLHF、veRL、TRL 三个框架如何选型?
- Constitutional AI(RLAIF)如何减少对人工标注的依赖?
- 什么是对齐税(Alignment Tax)?如何缓解?
一、对齐技术演进路线¶
RLHF(InstructGPT, 2022)
├─ PPO:四模型,训练复杂,显存压力大
└─ 改进方向:
├─ DPO(2023):去掉 RM,离线偏好优化
├─ RLVR(2025):可验证奖励,专攻推理
│ ├─ GRPO(DeepSeek-R1)
│ ├─ DAPO(字节/清华)
│ ├─ Dr. GRPO
│ └─ REINFORCE++
└─ RLAIF/Constitutional AI:AI 替代人工标注
二、RLVR(Reinforcement Learning with Verifiable Rewards)¶
核心思想:用可程序化验证的奖励信号替代奖励模型,彻底绕开 Reward Hacking 问题。
可验证奖励的形式¶
| 任务类型 | 验证方式 | 奖励信号 |
|---|---|---|
| 数学 | 符号计算引擎验证最终答案 | 正确 +1,错误 0 |
| 代码 | 运行单元测试 | 通过率作为连续奖励 |
| 逻辑推理 | 形式化验证 | 布尔值 |
| 格式要求 | 正则匹配(如含 <think> 标签) |
0/1 |
优势:奖励信号客观、可扩展、无法被"欺骗"(模型无法对数学验证器进行 Reward Hacking)。
局限:只适用于有客观答案的任务,开放性创意写作等无法使用。
三、GRPO vs PPO vs REINFORCE++ 对比¶
| 算法 | Critic 网络 | 基线估计 | 通信开销 | 适用场景 |
|---|---|---|---|---|
| PPO | 需要(额外显存) | 价值函数 V(s) | 高(4模型) | 通用对话对齐 |
| GRPO | 不需要 | 组内奖励均值 | 低(2模型) | 数学/代码推理 |
| REINFORCE++ | 不需要 | Running mean baseline | 极低 | 简单推理任务 |
GRPO 核心公式¶
# 对同一问题采样 G 条输出
outputs = [model.generate(question) for _ in range(G)] # G=8~16
rewards = [verify(output, ground_truth) for output in outputs]
# 组内归一化(去掉绝对奖励,只看相对优劣)
advantages = (rewards - mean(rewards)) / (std(rewards) + eps)
# 策略梯度更新
loss = -sum(
min(ratio * advantage, clip(ratio, 1-ε, 1+ε) * advantage)
for ratio, advantage in zip(ratios, advantages)
)
四、DAPO(字节跳动 × 清华,2025)¶
DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization)针对 GRPO 训练不稳定问题提出了系统性改进。
GRPO 的已知问题¶
| 问题 | 描述 |
|---|---|
| 熵坍塌 | 训练后期模型输出多样性急剧下降,陷入重复模式 |
| Token 截断偏差 | 长推理链被 max_length 截断,截断样本的梯度信号有偏 |
| 组内同质化 | 所有采样结果都正确或都错误时,优势函数为 0,无梯度 |
DAPO 的四项改进¶
① Clip-Higher(非对称 Clip)
GRPO 对正/负优势使用相同 clip 范围 [1-ε, 1+ε]。DAPO 对正优势放宽上界(允许更大的策略更新),对负优势保持收紧:
# GRPO:对称 clip
ratio_clipped = clip(ratio, 1-ε, 1+ε)
# DAPO:Clip-Higher,正优势上界更大
if advantage > 0:
ratio_clipped = clip(ratio, 1-ε, 1+ε_high) # ε_high > ε
else:
ratio_clipped = clip(ratio, 1-ε, 1+ε)
② Token 级别 Policy Gradient Loss
GRPO 在 sequence 级别计算 loss,被截断的序列贡献了错误梯度。DAPO 改为 token 级别,对截断 token 单独处理。
③ 动态采样过滤
当组内所有样本奖励相同(全对/全错),直接跳过该组,不产生零梯度噪声。
④ 熵奖励
在主奖励中加入熵正则化项,防止熵坍塌:total_reward = task_reward + β * entropy
五、Dr. GRPO(2025)¶
Dr. GRPO 发现 GRPO 中存在两个系统性偏差:
- 长度偏差(Length Bias):更长的输出在 token 级别平均后会得到更低的梯度权重,导致模型倾向于生成短回答。
- 难度偏差(Difficulty Bias):不同难度的问题组内奖励方差不同,方差大的问题主导梯度更新。
修正方法:对每个样本的 loss 按序列长度归一化,同时对不同难度问题的梯度进行标准化。
六、Constitutional AI / RLAIF¶
Constitutional AI(CAI) 是 Anthropic 提出的减少人工标注依赖的对齐方法。
核心流程¶
阶段1:SL-CAI(监督学习)
原始回复 → AI 批评(基于宪法原则)→ AI 修正 → 修正后数据训练
阶段2:RL-CAI(强化学习)
生成回复对 → AI 评判哪个更好(RLAIF)→ 训练偏好模型 → PPO/DPO
宪法原则示例¶
宪法(Constitution)—— 一组 AI 行为准则:
- "选择不包含有害、不道德、种族主义或性别歧视内容的回复"
- "选择最支持和重视非暴力的回复"
- "选择对人类最有益的回复"
...
RLAIF vs RLHF:
| 维度 | RLHF | RLAIF |
|---|---|---|
| 标注者 | 人类标注员 | AI 模型 |
| 成本 | 高(人工费用) | 低(API 调用) |
| 可扩展性 | 差(人力瓶颈) | 好 |
| 偏差来源 | 人类主观偏好 | AI 训练偏差 |
| 质量 | 高(对复杂任务) | 接近,部分任务更一致 |
七、开源 RLHF 训练框架¶
OpenRLHF¶
GitHub:github.com/OpenRLHF/OpenRLHF
基于 Ray 分布式框架,支持 PPO/GRPO/DPO/RLVR,70B 模型训练首选:
# 启动 PPO 训练
ray start --head
python examples/train_ppo.py \
--pretrain Qwen/Qwen3-8B \
--reward_pretrain OpenRLHF/Llama-3-8b-rm-700k \
--save_path ./checkpoint \
--micro_train_batch_size 4 \
--train_batch_size 128
veRL(HybridFlow,字节跳动)¶
GitHub:github.com/verl-project/verl
将数据流(DataFlow)和控制流(ControlFlow)分离,支持灵活的混合并行策略(不同阶段用不同并行方式),大规模 RLHF 训练效率优于 OpenRLHF。
TRL(HuggingFace)¶
GitHub:github.com/huggingface/trl
最易上手,与 HuggingFace 生态无缝集成,适合中小模型和快速实验:
from trl import GRPOTrainer, GRPOConfig
trainer = GRPOTrainer(
model=model,
reward_funcs=[math_reward_fn], # 可验证奖励函数
args=GRPOConfig(
num_generations=8, # G=8
max_completion_length=2048,
learning_rate=1e-6,
),
train_dataset=dataset,
)
trainer.train()
三框架选型¶
| 场景 | 推荐框架 |
|---|---|
| 快速实验 / 中小模型(<13B) | TRL |
| 大模型(>30B)/ 生产训练 | OpenRLHF |
| 超大规模(70B+)/ 极致效率 | veRL |
八、Weak-to-Strong Generalization(OpenAI,2024)¶
核心问题:当 AI 能力超越人类时,人类如何监督对齐超人类模型?
实验设置:用弱模型(GPT-2)训练的标签去微调强模型(GPT-4 规模),观察是否能激发强模型的"潜力"。
发现:强模型在弱监督下仍能表现出远超弱监督者能力的泛化,说明正确的训练框架可以让弱监督者引导更强的模型。
影响:为可扩展监督(Scalable Oversight)提供了实证基础——Debate、Amplification 等方法的理论支撑。
九、对齐税(Alignment Tax)¶
定义:经过 RLHF/SFT 对齐训练后,模型在某些能力上出现性能下降,这种"对齐的代价"称为对齐税。
表现: - 数学/代码能力略有下降(过于保守的拒绝) - 创意写作受限 - 某些专业知识问答能力下降(过度安全过滤)
缓解方法: - 混合 SFT 数据(能力数据 + 对齐数据,防止遗忘) - DPO 代替 PPO(离线训练,对能力损伤更小) - RLVR 只在推理能力上施加梯度(不影响其他能力)
面试延伸¶
Q:为什么 RLVR 在数学/代码任务上比 DPO 效果更好?
DPO 是离线的静态偏好优化,训练数据固定,无法动态探索新的正确推理路径。RLVR 是在线学习,模型每次采样新推理链并验证,可以发现训练数据中不存在的新正确解法。对于数学推理,这种"试错-验证-强化"的循环可以持续提升模型的推理上限,而 DPO 受限于离线数据质量的上限。
Q:GRPO 的"组内均值基线"和 PPO 的"Critic 基线"相比,各有什么问题?
PPO 的 Critic 需要额外训练一个价值函数网络,显存翻倍,且 Critic 本身可能估计不准(尤其是 OOD 情况)。GRPO 的组内均值简单无偏,但有以下问题:① 当组内全对/全错时方差为 0,无梯度(DAPO 的动态采样解决);② 方差估计依赖采样数 G,G 太小时噪声大;③ 引入了 Dr. GRPO 发现的长度偏差和难度偏差。两者都是在"无需参考模型"这一目标下的工程权衡。
Q:Constitutional AI 的"宪法"由谁制定?会有偏见吗?
宪法由 Anthropic 的研究团队制定,不可避免地包含制定者的价值观和文化背景偏见。这是 CAI 的核心争议之一——"谁来定义 AI 应该遵循什么原则?"。Anthropic 的做法是尽量使原则普适化(无害、诚实、有益),并公开宪法供社区审查。更根本的问题(谁有权定义 AI 价值观)是 AI 对齐领域尚未解决的哲学难题。
原始论文与资源¶
| 资源 | 链接 |
|---|---|
| DeepSeek-R1 / GRPO | arXiv:2501.12948 |
| DAPO(字节/清华,2025) | arXiv:2503.14476 |
| Dr. GRPO(2025) | arXiv:2503.20783 |
| Constitutional AI(Anthropic,2022) | arXiv:2212.08073 |
| Clipping Bottleneck: Stabilizing RLVR(2026) | arXiv:2605.22703 |
| F-GRPO: Don't Let Your Policy Learn the Obvious(2026) | arXiv:2602.06717 |
| Prune as You Generate: Online Rollout Pruning for RLVR(2026) | arXiv:2603.24840 |
| Weak-to-Strong Generalization(OpenAI,2024) | arXiv:2312.09390 |
| OpenRLHF GitHub | github.com/OpenRLHF/OpenRLHF |
| veRL GitHub | github.com/verl-project/verl |
| TRL GitHub | github.com/huggingface/trl |
延伸阅读与视频¶
| 平台 | 标题 | 说明 |
|---|---|---|
| 📄 Paper | DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models | GRPO 相关训练方法来源之一,适合追公式与动机 |
| 📄 Paper | DAPO: An Open-Source LLM Reinforcement Learning System at Scale | DAPO 方法与工程细节原始论文 |
| 📺 B站 | 图解DeepSeek的GRPO原理 + debug形式阅读GRPO源码 | 3万播放,源码级讲解GRPO实现细节 |
| 📖 GitHub | verl | 大规模 RLHF/GRPO/DAPO 训练框架项目页 |
| 📺 B站 | 字节跳动与清华发布强化学习新算法DAPO,性能超越DeepSeek-R1 | 3.1万播放,DAPO论文详细解读 |