GRPO 与可验证奖励
GRPO 把 PPO 里的 critic 换成「同一题多次采样的平均分」做基线,省掉一个模型;配合可验证奖励(RLVR:数学能对答案、代码能跑测试),奖励不再靠人标。这就是推理模型训练里它常见的原因 —— 推理任务恰好有可验证的对错。
也叫:GRPO · RLVR · 可验证奖励 · critic · 推理模型训练
第三档:GRPO 把 critic 换成了同学的平均分出自 T4-1
GRPO(Group Relative Policy Optimization,组相对策略优化)的想法一句话说得清:PPO 需要一个 critic 网络来告诉它"这题平均能拿多少分",那我们干脆对同一道题多采几份答案,用这几份的平均分当基线。
for x in prompts:
ys = sample(pi_theta, x, n=G) # 同题采 G 份,典型 G = 8 ~ 16
rs = [verify(y) for y in ys] # 可验证奖励:跑测试 / 对答案 / 比字段
A = (rs - mean(rs)) / (std(rs) + eps) # 组内标准化,就是「优势」
update(pi_theta, clipped_ratio * A - beta * KL(pi_theta, pi_ref))于是 critic 网络没了——省下一个和策略同规模的模型。这就是 GRPO 在推理模型训练里迅速铺开的直接原因:同等效果下算力更省,而推理训练本来就极贵。
它和 RLVR 是天生一对:GRPO 需要 reward 被便宜地算很多次(每个 prompt 至少 G 次),而可验证奖励恰好是"跑一下就知道"的、几乎免费的。
三段式评价 GRPO:
- 解决什么:在有自动判分器的任务上,用比 PPO 低得多的成本拿到真实的能力增量。
- 代价是什么:采样成本高(每题生成 G 份,训练时间的大头在生成而非反向传播);零方差塌缩(一组答案全对或全错时,标准化后优势全是 0,这一组白跑);长度偏置(归一化方式会让长/短回答被系统性偏爱)。
- 什么时候不该用:你的任务写不出自动判分器时。硬凑一个"用大模型当判分器"的方案,本质上是把 reward hacking 的靶子从人换成了另一个模型,通常更脆。
这里是本章最好的进阶加分点:截至 2026-08,GRPO 已经被修补了一整代变体,每个变体对应上面一个毛病——
| 变体 | 修的是什么 |
|---|---|
| Dr. GRPO | 优势归一化里的长度偏置 |
| DAPO | 动态采样过滤掉零方差组 + 解耦 clip 上下界,训练更稳(报告 Qwen2.5-32B 在 AIME 2024 达到 50) |
| GSPO / DHPO | token 级更新与序列级奖励的错配 |
| ARPO | 多轮 agentic 场景下的信用分配 |
| VPO | test-time 采样多样性(best@k 场景) |
以上节选自T4-1 后训练主线:从 SFT 到 GRPO,三种监督信号决定你能走到哪一档,读全文能看到前后语境。