GRPO 与可验证奖励

微调与对齐深水4讲解 2

GRPO 把 PPO 里的 critic 换成「同一题多次采样的平均分」做基线,省掉一个模型;配合可验证奖励(RLVR:数学能对答案、代码能跑测试),奖励不再靠人标。这就是推理模型训练里它常见的原因 —— 推理任务恰好有可验证的对错。

也叫:GRPO · RLVR · 可验证奖励 · critic · 推理模型训练

第三档:GRPO 把 critic 换成了同学的平均分出自 T4-1

GRPO(Group Relative Policy Optimization,组相对策略优化)的想法一句话说得清:PPO 需要一个 critic 网络来告诉它"这题平均能拿多少分",那我们干脆对同一道题多采几份答案,用这几份的平均分当基线。

for x in prompts:
    ys = sample(pi_theta, x, n=G)                 # 同题采 G 份,典型 G = 8 ~ 16
    rs = [verify(y) for y in ys]                  # 可验证奖励:跑测试 / 对答案 / 比字段
    A  = (rs - mean(rs)) / (std(rs) + eps)        # 组内标准化,就是「优势」
    update(pi_theta, clipped_ratio * A - beta * KL(pi_theta, pi_ref))

于是 critic 网络没了——省下一个和策略同规模的模型。这就是 GRPO 在推理模型训练里迅速铺开的直接原因:同等效果下算力更省,而推理训练本来就极贵。

它和 RLVR 是天生一对:GRPO 需要 reward 被便宜地算很多次(每个 prompt 至少 G 次),而可验证奖励恰好是"跑一下就知道"的、几乎免费的。

三段式评价 GRPO:

  • 解决什么:在有自动判分器的任务上,用比 PPO 低得多的成本拿到真实的能力增量。
  • 代价是什么:采样成本高(每题生成 G 份,训练时间的大头在生成而非反向传播);零方差塌缩(一组答案全对或全错时,标准化后优势全是 0,这一组白跑);长度偏置(归一化方式会让长/短回答被系统性偏爱)。
  • 什么时候不该用:你的任务写不出自动判分器时。硬凑一个"用大模型当判分器"的方案,本质上是把 reward hacking 的靶子从人换成了另一个模型,通常更脆。

这里是本章最好的进阶加分点:截至 2026-08,GRPO 已经被修补了一整代变体,每个变体对应上面一个毛病——

变体 修的是什么
Dr. GRPO 优势归一化里的长度偏置
DAPO 动态采样过滤掉零方差组 + 解耦 clip 上下界,训练更稳(报告 Qwen2.5-32B 在 AIME 2024 达到 50)
GSPO / DHPO token 级更新与序列级奖励的错配
ARPO 多轮 agentic 场景下的信用分配
VPO test-time 采样多样性(best@k 场景)

以上节选自T4-1 后训练主线:从 SFT 到 GRPO,三种监督信号决定你能走到哪一档,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到3