第 04 课 · 教它思考

RLHF 与 GRPO

要四个模型。 用一组采样的平均分当老师,于是小团队也能炼推理。

R1-ZeroDAPO

Archify · workflow

GRPO:一组回答自己比高低

同一道题采 8–16 个回答,对的强化,错的压下去。

  1. 数学题
  2. 采 G=8
  3. 对错奖励
  4. 组相对优势
  5. GRPOTrainer

出题

组内比较

走一步

生成

数学题

GSM8K 7500 道

采 G=8

同一策略采样

可开 vLLM

打分

对错奖励

1 或 0

RLVR

组相对优势

(r−μ)/σ

更新

GRPOTrainer

lr 1e-6 量级

无 critic

推理变长

正确率上升

  • 采 G=8 → 8 个完整回答
  • 组相对优势 → 正的加强

跟上第 4 课

  • 必须用 Base 模型,不要 Instruct
  • T4 请换成 0.6B,否则 GRPO 爆显存

课堂 vs 工业

  • 课堂 GRPO 1.5B GSM8K 约 55%
  • R1-Distill-Qwen-1.5B 约 83.5%,别灰心

经典 RLHF 为什么贵

InstructGPT 的流水线

  1. 1

    SFT

    先有一个会说话的策略。

  2. 2

    奖励模型

    人标偏好,训一个打分器 r(x,y)。

  3. 3

    PPO

    一边生成一边优化, 拉住 参考。

PPO 一次要养四份权重

角色干什么能否省
Actor 策略正在训练的语言模型不能
Reference冻结的 ,算 / 可改写
给回复打标量分有时可换规则
Critic 价值网络估计基线,算 用组统计量替代

7B 级四模型权重大约 56GB,加上优化器状态,总占用常到 150~200GB。脆点:、 爆炸、价值网络崩。

GRPO:一组里比高低

核心洞察

别再训一个价值网络,问同组同学就行

对同一道题采样 G=8~16 个回复。谁比组内平均分高,就强化;谁低,就抑制。被标准差归一化,于是 0/1 奖励也能用。

组相对优势

FORMULA

Â_i = ( r_i − μ ) / σ

μ、σ 来自这一组的奖励。这就是「Group Relative」:高低是相对的,不是绝对的。

八个回答,谁该被强化?

给每个采样点对或错。看均值、标准差和如何出现。全对或全错时为 0——没有区分度,这一组等于白采。

同一道题采 8 个回复。点格子切换对(1)/ 错(0)。

μ 均值

0.63

σ 标准差

0.48

有效信号

有

优势为正应强化,为负应抑制。全对或全错时 σ≈0,这组没有区分度——DAPO 的动态采样就是在扔掉这种空组。

起步超参

符号含义常见范围
G每题采样条数8~16
系数0.001~0.01(比 小得多)
ε 裁剪0.1~0.2
lr1e-6~5e-6

R1-Zero:推理是涌现的

AIME 2024 pass@1

模型分数怎么训的
DeepSeek-V3-Base15.6%,没
DeepSeek-R1-Zero71.0%纯 ,无
OpenAI o1-091279.2%未公开

出的不是背答案,而是思维链、自我验证、回溯,甚至训练日志里的「顿悟时刻」。

DeepSeek-R1 的完整四段(与 Zero 不同)

1

冷启动 SFT

先用可读的长思维链,避免 Zero 那种「能对但难看」。

2

推理 GRPO

可验证任务上强化。

3

拒绝采样 SFT

把 RL 产出里的好轨迹再回模型。

4

最终 RL

全面偏好与规则,拉齐有用和安全。

改进与测试时计算

算法还在变薄、变稳

DAPO

AIME 31.4% → 41.0%

clip-higher、动态采样、 级损失、超长惩罚。解决「组内全对/全错没有梯度」。

Dr.GRPO

去掉长度偏置

原始归一化会偏向更长的回复。更公平的基线让短而正确的解也能活。

REINFORCE++

再简化 PPO

继续削弱 critic,追求像 一样好跑的 RL。

第 4 课带走的话

  1. 01没有,不要急着上 。
  2. 02 的本质是组内排名,不是新魔法。
  3. 03全对或全错的组没有学习信号。
  4. 04依赖干净的对错,不依赖抄来的思维链。
  5. 05推理也可以买:测试时计算是另一条杠杆。

本课两道小题

第 4 课

GRPO 为什么能砍掉 PPO 里的 Critic(价值网络)?

Group Relative 这四个字。

第 4 课

DeepSeek-R1-Zero 最让人惊讶的一点是?

它几乎没做 SFT。