第 06 课 · 收成

项目、图谱与你的方法

不要同时做所有算法。选一条赛道,跑通闭环,再写你自己的方法论海报。

项目赛道决策树方法论前沿

Archify · workflow

训练小白怎么跟上老师

先把第一次 SFT 跑通,再谈下一课算法。

  1. 租 A100-40G
  2. 装 TRL 全家桶
  3. nvidia-smi
  4. 第一次 SFT
  5. 10 条对比
  6. 再进下一课

第 0 天:开机

第一次训练

交差再往下

你这边

租 A100-40G

AutoDL 约 3.45 元/时

10 条对比

训前 vs 训后

再进下一课

别并行开新算法

训练机

装 TRL 全家桶

transformers ≥ 4.51

一次性

nvidia-smi

CUDA 必须亮

绿灯

第一次 SFT

Qwen3-1.7B QLoRA

约 45 分钟

卡住了

版本不够

Qwen3 加载失败

显存爆了

改 0.6B 或 Unsloth

  • nvidia-smi → 绿灯才训
  • 10 条对比 → 有对照再往下
  • 装 TRL 全家桶 → 加载失败
  • 第一次 SFT → OOM

跟上的定义

  • 跟上老师 = 第一次 SFT 跑通,并且留下训前训后对照
  • 不要第一周就并行开 DPO / GRPO

先修这两个坑

  • transformers < 4.51.0 时 Qwen3 根本加载不了
  • T4 16GB 请改 Qwen3-0.6B 或 Unsloth,不要硬上 1.7B

后训练全景,收成一张图

工业界的顺序

SFT 打底 → 对齐或 RL → 压缩扩展

Qwen3:冷启动 → 推理 RL → 思考模式融合 → 通用 RL。每一步都吃前一步的果实。理解顺序,比背任何一个损失公式更重要。

Qwen3 四阶段对照课程

阶段对应课方法目的
冷启动 第 1–2 课长思维链 先有推理格式
推理 RL第 4 课数学/代码 强化思考
模式融合第 5 课自 + 混合think / no_think 共存
通用 RL第 3–4 课 + RL全面拉齐

七条可做的赛道

选一条能讲清楚的故事

数学

SFT + GRPO

可验证答案,最适合看。

安全

SFT + DPO

有害请求拒绝率是硬指标。

中文写作

SFT + SimPO

无,显存更友好。

代码

SFT + RLVR

测试用例当奖励。

领域

SFT + 量化部署

真能上线才算完成。

视觉问答

多模态 SFT + DPO

先接通投影层。

工具

SFT + 智能体循环

schema 对了才有手。

还在动的前沿

六条值得盯住的线

更高效的 RL

更少采样、更稳,让 RL 像 一样好跑。

多模态推理

不仅看见,还要逐步想图里的关系。

长上下文

如果只在 2K 上,上线 32K 会露怯。

自我改进

模型生成、过滤、再训练的闭环。

合成数据

MAGPIE 只是开始,质量过滤才是护城河。

安全与滥用

能力越强,越要同步对齐。

可以当作纪律的话

  1. 01先有评估,再有训练。
  2. 02先小模型闭环,再放大。
  3. 03能自动判对错,就不要用模糊奖励。
  4. 04数据脏,算法再新也救不回来。
  5. 05部署是的最后一公里,不是附录。

本课两道小题

第 6 课

如果任务是「数学答案对不对」且可以自动判分,优先选哪条路?

可验证奖励。