1
冷启动 SFT
先用可读的长思维链,避免 Zero 那种「能对但难看」。
第 04 课 · 教它思考
要四个模型。 用一组采样的平均分当老师,于是小团队也能炼推理。
Archify · workflow
同一道题采 8–16 个回答,对的强化,错的压下去。
出题
组内比较
走一步
生成
数学题
GSM8K 7500 道
采 G=8
同一策略采样
可开 vLLM
打分
对错奖励
1 或 0
RLVR
组相对优势
(r−μ)/σ
更新
GRPOTrainer
lr 1e-6 量级
无 critic
推理变长
正确率上升
跟上第 4 课
课堂 vs 工业
SFT
先有一个会说话的策略。
奖励模型
人标偏好,训一个打分器 r(x,y)。
PPO
一边生成一边优化, 拉住 参考。
PPO 一次要养四份权重
| 角色 | 干什么 | 能否省 |
|---|---|---|
| Actor 策略 | 正在训练的语言模型 | 不能 |
| Reference | 冻结的 ,算 | / 可改写 |
| 给回复打标量分 | 有时可换规则 | |
| Critic 价值网络 | 估计基线,算 | 用组统计量替代 |
7B 级四模型权重大约 56GB,加上优化器状态,总占用常到 150~200GB。脆点:、 爆炸、价值网络崩。
核心洞察
对同一道题采样 G=8~16 个回复。谁比组内平均分高,就强化;谁低,就抑制。被标准差归一化,于是 0/1 奖励也能用。
组相对优势
FORMULA
Â_i = ( r_i − μ ) / σ
μ、σ 来自这一组的奖励。这就是「Group Relative」:高低是相对的,不是绝对的。
给每个采样点对或错。看均值、标准差和如何出现。全对或全错时为 0——没有区分度,这一组等于白采。
同一道题采 8 个回复。点格子切换对(1)/ 错(0)。
μ 均值
0.63
σ 标准差
0.48
有效信号
有
优势为正应强化,为负应抑制。全对或全错时 σ≈0,这组没有区分度——DAPO 的动态采样就是在扔掉这种空组。
起步超参
| 符号 | 含义 | 常见范围 |
|---|---|---|
| G | 每题采样条数 | 8~16 |
| 系数 | 0.001~0.01(比 小得多) | |
| ε | 裁剪 | 0.1~0.2 |
| lr | 1e-6~5e-6 |
AIME 2024 pass@1
| 模型 | 分数 | 怎么训的 |
|---|---|---|
| DeepSeek-V3-Base | 15.6% | ,没 |
| DeepSeek-R1-Zero | 71.0% | 纯 ,无 |
| OpenAI o1-0912 | 79.2% | 未公开 |
出的不是背答案,而是思维链、自我验证、回溯,甚至训练日志里的「顿悟时刻」。
1
先用可读的长思维链,避免 Zero 那种「能对但难看」。
2
可验证任务上强化。
3
把 RL 产出里的好轨迹再回模型。
4
全面偏好与规则,拉齐有用和安全。
DAPO
clip-higher、动态采样、 级损失、超长惩罚。解决「组内全对/全错没有梯度」。
Dr.GRPO
原始归一化会偏向更长的回复。更公平的基线让短而正确的解也能活。
REINFORCE++
继续削弱 critic,追求像 一样好跑的 RL。
第 4 课
Group Relative 这四个字。
第 4 课
它几乎没做 SFT。