数学
SFT + GRPO
可验证答案,最适合看。
第 06 课 · 收成
不要同时做所有算法。选一条赛道,跑通闭环,再写你自己的方法论海报。
Archify · workflow
先把第一次 SFT 跑通,再谈下一课算法。
第 0 天:开机
第一次训练
交差再往下
你这边
租 A100-40G
AutoDL 约 3.45 元/时
10 条对比
训前 vs 训后
再进下一课
别并行开新算法
训练机
装 TRL 全家桶
transformers ≥ 4.51
一次性
nvidia-smi
CUDA 必须亮
绿灯
第一次 SFT
Qwen3-1.7B QLoRA
约 45 分钟
卡住了
版本不够
Qwen3 加载失败
显存爆了
改 0.6B 或 Unsloth
跟上的定义
先修这两个坑
工业界的顺序
Qwen3:冷启动 → 推理 RL → 思考模式融合 → 通用 RL。每一步都吃前一步的果实。理解顺序,比背任何一个损失公式更重要。
Qwen3 四阶段对照课程
| 阶段 | 对应课 | 方法 | 目的 |
|---|---|---|---|
| 冷启动 | 第 1–2 课 | 长思维链 | 先有推理格式 |
| 推理 RL | 第 4 课 | 数学/代码 | 强化思考 |
| 模式融合 | 第 5 课 | 自 + 混合 | think / no_think 共存 |
| 通用 RL | 第 3–4 课 | + RL | 全面拉齐 |
数学
可验证答案,最适合看。
安全
有害请求拒绝率是硬指标。
中文写作
无,显存更友好。
代码
测试用例当奖励。
领域
真能上线才算完成。
视觉问答
先接通投影层。
工具
schema 对了才有手。
更少采样、更稳,让 RL 像 一样好跑。
不仅看见,还要逐步想图里的关系。
如果只在 2K 上,上线 32K 会露怯。
模型生成、过滤、再训练的闭环。
MAGPIE 只是开始,质量过滤才是护城河。
能力越强,越要同步对齐。
第 6 课
可验证奖励。