跳转至

2025 前沿对齐技术(RLVR / DAPO / RLAIF / OpenRLHF / veRL)

面试高频考点

  • RLVR 和 RLHF 的核心区别是什么?为什么适合推理模型训练?
  • DAPO 解决了 GRPO 的什么问题?Clip-Higher 策略是什么?
  • OpenRLHF、veRL、TRL 三个框架如何选型?
  • Constitutional AI(RLAIF)如何减少对人工标注的依赖?
  • 什么是对齐税(Alignment Tax)?如何缓解?

一、对齐技术演进路线

RLHF(InstructGPT, 2022)
  ├─ PPO:四模型,训练复杂,显存压力大
  └─ 改进方向:
       ├─ DPO(2023):去掉 RM,离线偏好优化
       ├─ RLVR(2025):可验证奖励,专攻推理
       │    ├─ GRPO(DeepSeek-R1)
       │    ├─ DAPO(字节/清华)
       │    ├─ Dr. GRPO
       │    └─ REINFORCE++
       └─ RLAIF/Constitutional AI:AI 替代人工标注

二、RLVR(Reinforcement Learning with Verifiable Rewards)

核心思想:用可程序化验证的奖励信号替代奖励模型,彻底绕开 Reward Hacking 问题。

可验证奖励的形式

任务类型 验证方式 奖励信号
数学 符号计算引擎验证最终答案 正确 +1,错误 0
代码 运行单元测试 通过率作为连续奖励
逻辑推理 形式化验证 布尔值
格式要求 正则匹配(如含 <think> 标签) 0/1

优势:奖励信号客观、可扩展、无法被"欺骗"(模型无法对数学验证器进行 Reward Hacking)。

局限:只适用于有客观答案的任务,开放性创意写作等无法使用。


三、GRPO vs PPO vs REINFORCE++ 对比

算法 Critic 网络 基线估计 通信开销 适用场景
PPO 需要(额外显存) 价值函数 V(s) 高(4模型) 通用对话对齐
GRPO 不需要 组内奖励均值 低(2模型) 数学/代码推理
REINFORCE++ 不需要 Running mean baseline 极低 简单推理任务

GRPO 核心公式

# 对同一问题采样 G 条输出
outputs = [model.generate(question) for _ in range(G)]  # G=8~16
rewards = [verify(output, ground_truth) for output in outputs]

# 组内归一化(去掉绝对奖励,只看相对优劣)
advantages = (rewards - mean(rewards)) / (std(rewards) + eps)

# 策略梯度更新
loss = -sum(
    min(ratio * advantage, clip(ratio, 1-ε, 1+ε) * advantage)
    for ratio, advantage in zip(ratios, advantages)
)

四、DAPO(字节跳动 × 清华,2025)

DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization)针对 GRPO 训练不稳定问题提出了系统性改进。

论文arXiv:2503.14476

GRPO 的已知问题

问题 描述
熵坍塌 训练后期模型输出多样性急剧下降,陷入重复模式
Token 截断偏差 长推理链被 max_length 截断,截断样本的梯度信号有偏
组内同质化 所有采样结果都正确或都错误时,优势函数为 0,无梯度

DAPO 的四项改进

① Clip-Higher(非对称 Clip)

GRPO 对正/负优势使用相同 clip 范围 [1-ε, 1+ε]。DAPO 对正优势放宽上界(允许更大的策略更新),对负优势保持收紧:

# GRPO:对称 clip
ratio_clipped = clip(ratio, 1-ε, 1+ε)

# DAPO:Clip-Higher,正优势上界更大
if advantage > 0:
    ratio_clipped = clip(ratio, 1-ε, 1+ε_high)  # ε_high > ε
else:
    ratio_clipped = clip(ratio, 1-ε, 1+ε)

② Token 级别 Policy Gradient Loss

GRPO 在 sequence 级别计算 loss,被截断的序列贡献了错误梯度。DAPO 改为 token 级别,对截断 token 单独处理。

③ 动态采样过滤

当组内所有样本奖励相同(全对/全错),直接跳过该组,不产生零梯度噪声。

④ 熵奖励

在主奖励中加入熵正则化项,防止熵坍塌:total_reward = task_reward + β * entropy


五、Dr. GRPO(2025)

Dr. GRPO 发现 GRPO 中存在两个系统性偏差:

  1. 长度偏差(Length Bias):更长的输出在 token 级别平均后会得到更低的梯度权重,导致模型倾向于生成短回答。
  2. 难度偏差(Difficulty Bias):不同难度的问题组内奖励方差不同,方差大的问题主导梯度更新。

修正方法:对每个样本的 loss 按序列长度归一化,同时对不同难度问题的梯度进行标准化。

论文arXiv:2503.20783


六、Constitutional AI / RLAIF

Constitutional AI(CAI) 是 Anthropic 提出的减少人工标注依赖的对齐方法。

核心流程

阶段1:SL-CAI(监督学习)
  原始回复 → AI 批评(基于宪法原则)→ AI 修正 → 修正后数据训练

阶段2:RL-CAI(强化学习)
  生成回复对 → AI 评判哪个更好(RLAIF)→ 训练偏好模型 → PPO/DPO

宪法原则示例

宪法(Constitution)—— 一组 AI 行为准则:
- "选择不包含有害、不道德、种族主义或性别歧视内容的回复"
- "选择最支持和重视非暴力的回复"
- "选择对人类最有益的回复"
...

RLAIF vs RLHF

维度 RLHF RLAIF
标注者 人类标注员 AI 模型
成本 高(人工费用) 低(API 调用)
可扩展性 差(人力瓶颈)
偏差来源 人类主观偏好 AI 训练偏差
质量 高(对复杂任务) 接近,部分任务更一致

七、开源 RLHF 训练框架

OpenRLHF

GitHubgithub.com/OpenRLHF/OpenRLHF

基于 Ray 分布式框架,支持 PPO/GRPO/DPO/RLVR,70B 模型训练首选:

# 启动 PPO 训练
ray start --head
python examples/train_ppo.py \
  --pretrain Qwen/Qwen3-8B \
  --reward_pretrain OpenRLHF/Llama-3-8b-rm-700k \
  --save_path ./checkpoint \
  --micro_train_batch_size 4 \
  --train_batch_size 128

veRL(HybridFlow,字节跳动)

GitHubgithub.com/verl-project/verl

将数据流(DataFlow)和控制流(ControlFlow)分离,支持灵活的混合并行策略(不同阶段用不同并行方式),大规模 RLHF 训练效率优于 OpenRLHF。

TRL(HuggingFace)

GitHubgithub.com/huggingface/trl

最易上手,与 HuggingFace 生态无缝集成,适合中小模型和快速实验:

from trl import GRPOTrainer, GRPOConfig

trainer = GRPOTrainer(
    model=model,
    reward_funcs=[math_reward_fn],  # 可验证奖励函数
    args=GRPOConfig(
        num_generations=8,           # G=8
        max_completion_length=2048,
        learning_rate=1e-6,
    ),
    train_dataset=dataset,
)
trainer.train()

三框架选型

场景 推荐框架
快速实验 / 中小模型(<13B) TRL
大模型(>30B)/ 生产训练 OpenRLHF
超大规模(70B+)/ 极致效率 veRL

八、Weak-to-Strong Generalization(OpenAI,2024)

核心问题:当 AI 能力超越人类时,人类如何监督对齐超人类模型?

实验设置:用弱模型(GPT-2)训练的标签去微调强模型(GPT-4 规模),观察是否能激发强模型的"潜力"。

发现:强模型在弱监督下仍能表现出远超弱监督者能力的泛化,说明正确的训练框架可以让弱监督者引导更强的模型。

影响:为可扩展监督(Scalable Oversight)提供了实证基础——Debate、Amplification 等方法的理论支撑。


九、对齐税(Alignment Tax)

定义:经过 RLHF/SFT 对齐训练后,模型在某些能力上出现性能下降,这种"对齐的代价"称为对齐税。

表现: - 数学/代码能力略有下降(过于保守的拒绝) - 创意写作受限 - 某些专业知识问答能力下降(过度安全过滤)

缓解方法: - 混合 SFT 数据(能力数据 + 对齐数据,防止遗忘) - DPO 代替 PPO(离线训练,对能力损伤更小) - RLVR 只在推理能力上施加梯度(不影响其他能力)


面试延伸

Q:为什么 RLVR 在数学/代码任务上比 DPO 效果更好?

DPO 是离线的静态偏好优化,训练数据固定,无法动态探索新的正确推理路径。RLVR 是在线学习,模型每次采样新推理链并验证,可以发现训练数据中不存在的新正确解法。对于数学推理,这种"试错-验证-强化"的循环可以持续提升模型的推理上限,而 DPO 受限于离线数据质量的上限。

Q:GRPO 的"组内均值基线"和 PPO 的"Critic 基线"相比,各有什么问题?

PPO 的 Critic 需要额外训练一个价值函数网络,显存翻倍,且 Critic 本身可能估计不准(尤其是 OOD 情况)。GRPO 的组内均值简单无偏,但有以下问题:① 当组内全对/全错时方差为 0,无梯度(DAPO 的动态采样解决);② 方差估计依赖采样数 G,G 太小时噪声大;③ 引入了 Dr. GRPO 发现的长度偏差和难度偏差。两者都是在"无需参考模型"这一目标下的工程权衡。

Q:Constitutional AI 的"宪法"由谁制定?会有偏见吗?

宪法由 Anthropic 的研究团队制定,不可避免地包含制定者的价值观和文化背景偏见。这是 CAI 的核心争议之一——"谁来定义 AI 应该遵循什么原则?"。Anthropic 的做法是尽量使原则普适化(无害、诚实、有益),并公开宪法供社区审查。更根本的问题(谁有权定义 AI 价值观)是 AI 对齐领域尚未解决的哲学难题。


原始论文与资源

资源 链接
DeepSeek-R1 / GRPO arXiv:2501.12948
DAPO(字节/清华,2025) arXiv:2503.14476
Dr. GRPO(2025) arXiv:2503.20783
Constitutional AI(Anthropic,2022) arXiv:2212.08073
Clipping Bottleneck: Stabilizing RLVR(2026) arXiv:2605.22703
F-GRPO: Don't Let Your Policy Learn the Obvious(2026) arXiv:2602.06717
Prune as You Generate: Online Rollout Pruning for RLVR(2026) arXiv:2603.24840
Weak-to-Strong Generalization(OpenAI,2024) arXiv:2312.09390
OpenRLHF GitHub github.com/OpenRLHF/OpenRLHF
veRL GitHub github.com/verl-project/verl
TRL GitHub github.com/huggingface/trl

延伸阅读与视频

平台 标题 说明
📄 Paper DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models GRPO 相关训练方法来源之一,适合追公式与动机
📄 Paper DAPO: An Open-Source LLM Reinforcement Learning System at Scale DAPO 方法与工程细节原始论文
📺 B站 图解DeepSeek的GRPO原理 + debug形式阅读GRPO源码 3万播放,源码级讲解GRPO实现细节
📖 GitHub verl 大规模 RLHF/GRPO/DAPO 训练框架项目页
📺 B站 字节跳动与清华发布强化学习新算法DAPO,性能超越DeepSeek-R1 3.1万播放,DAPO论文详细解读