跟课工坊 · 不是课文复读

小白怎么
跟上老师

跟上 = 第一次 SFT 跑通,并且留下训前训后对照。公式可以后看。环境、训练、压测这三站不过,六课海报对你没用。

实验室进度 0/3。课程推荐 AutoDL A100-40G,学期大约 100 元。

先认这 13 个词

打开术语馆

点开看人话和记忆钩。正文里带点线的词也可以点。

Archify · workflow

训练小白怎么跟上老师

先把第一次 SFT 跑通,再谈下一课算法。

  1. 租 A100-40G
  2. 装 TRL 全家桶
  3. nvidia-smi
  4. 第一次 SFT
  5. 10 条对比
  6. 再进下一课

第 0 天:开机

第一次训练

交差再往下

你这边

租 A100-40G

AutoDL 约 3.45 元/时

10 条对比

训前 vs 训后

再进下一课

别并行开新算法

训练机

装 TRL 全家桶

transformers ≥ 4.51

一次性

nvidia-smi

CUDA 必须亮

绿灯

第一次 SFT

Qwen3-1.7B QLoRA

约 45 分钟

卡住了

版本不够

Qwen3 加载失败

显存爆了

改 0.6B 或 Unsloth

  • nvidia-smi → 绿灯才训
  • 10 条对比 → 有对照再往下
  • 装 TRL 全家桶 → 加载失败
  • 第一次 SFT → OOM

跟上的定义

  • 跟上老师 = 第一次 SFT 跑通,并且留下训前训后对照
  • 不要第一周就并行开 DPO / GRPO

先修这两个坑

  • transformers < 4.51.0 时 Qwen3 根本加载不了
  • T4 16GB 请改 Qwen3-0.6B 或 Unsloth,不要硬上 1.7B

按课次动手,不要平行开火

  1. 第 0 天

    租卡、装库、验证、下模型

    40 分钟去做
  2. 第 1 课实验

    只做一次 QLoRA SFT

    45–90 分钟去做为什么
  3. 训完立刻

    10 条提示对照

  4. 第 2 课

    同一套 SFT,只拧一个旋钮

    再训一小时去做为什么
  5. 第 3 课

    SFT 过关后再上 DPO

    约 2 小时去做为什么
  6. 第 4 课

    GSM8K + GRPO,看正确率

    约 90 分钟去做为什么
  7. 第 5 课

    量化对照显存和延迟

    约 40 分钟去做为什么
  8. 第 6 课

    写成你的方法论海报

公式海报,跑通再看

懂了「怎么做」再回来问为什么