说话 · 第 1 课
基座模型
Base Model
只读过海量文本、会续写下一句,但还没学过「你问我答」。
记忆钩
像读完图书馆的人,你一打招呼,他可能接着把目录背下去。
带走:博学,但不听话。
别和这个混:不是 Instruct。Instruct 是后训练过、会按指令回答的版本。
术语馆
每个词四件事:它是什么、怎么记、带走哪一句、别和谁搞混。正文里带点线的词也可以点。已记住 0/45。
看钩子猜名字。猜完点开看人话。
说话 · 第 1 课
Base Model
只读过海量文本、会续写下一句,但还没学过「你问我答」。
记忆钩
像读完图书馆的人,你一打招呼,他可能接着把目录背下去。
带走:博学,但不听话。
别和这个混:不是 Instruct。Instruct 是后训练过、会按指令回答的版本。
说话 · 第 1 课
Instruction-tuned 指令模型
基座经过后训练之后,会听指令、按格式回答的版本。
记忆钩
基座是生米,Instruct 是蒸熟的饭。
带走:课上要你动手训的,常常从 Base 开始,目标是变成 Instruct。
别和这个混:Qwen3-1.7B 和 Qwen3-1.7B-Base 不是同一个。GRPO 实验要用 Base。
说话 · 第 1 课
Pre-training
在万亿词上预测下一个字,把世界知识压进模型。又贵又慢,这门课不做。
记忆钩
学前班读遍百科。后训练才是上小学学答题。
带走:给知识。后训练给用法。
别和这个混:后训练只占大约 5% 算力,却决定模型能不能当助手。
说话 · 第 1 课
Post-training
预训练之后:教说话、教选择、教思考,再压缩部署。
记忆钩
四个动词:说话 SFT、选择 DPO、思考 GRPO、能用量化。
带走:这门课的全部地盘。
别和这个混:不是再从头预训练。不要把学习率开到预训练那么大。
说话 · 第 1 课
词片段 / 模型的字
模型真正读写的最小块。不一定是一个汉字,可能是半个词。
记忆钩
人看「量子计算」,模型可能看成「量 / 子计 / 算」几块积木。
带走:损失是按 token 算的,不是按句子。
别和这个混:参数量(几十亿)是模型体积;token 是这一次读写的字块。
说话 · 第 1 课
对话模板
把 system / user / assistant 角色用特殊标记包起来的对话格式。
记忆钩
像剧本:谁在说,用括号标清楚。标错了,戏就乱。
带走:不要手拼字符串,用 apply_chat_template。
别和这个混:格式错了训练不会报错,模型却会变怪。
说话 · 第 1 课
masked loss,只在 assistant 上算损失
问题不用学,只学「该回答的那几句」。user / system 的字损失记 0。
记忆钩
老师批改只看你的答卷,不把考题抄一遍算分。
带走:只学开口的那一段。
别和这个混:如果整段都算损失,模型会学会复述问题,而不是回答。
说话 · 第 1 课
Supervised Fine-Tuning 监督微调
拿「问题 → 标准回答」当教材,教模型按格式开口。
记忆钩
S = 标准答案,FT = 再练一遍。跟读课文。
带走:教说话。只会模仿,不会比较好坏。
别和这个混:不是 DPO。SFT 没有「更好/更差」,只有「照着念」。
说话 · 第 1 课
Low-Rank Adaptation 低秩适配
原权重冻结,只训练两个瘦小矩阵。改动很小,却能换风格。
记忆钩
冰山不动,只在表面贴一张可撕的便签。
带走:r 是便签厚度。先从 32 试。
别和这个混:不是量化。LoRA 是少训参数;量化是少占显存。
说话 · 第 1 课
Quantized LoRA = NF4 + LoRA
先把基座压成 4-bit,再在上面贴 LoRA。小显存也能微调。
记忆钩
把整座冰山冻瘦,便签还是贴在外面。
带走:课程第一次训练的默认配方。
别和这个混:Q 是量化,不是「更好的 LoRA」。精度换显存。
说话 · 第 2 课
LoRA rank
LoRA 那张便签有多厚。越大越能记住新本事,也越容易过拟合。
记忆钩
r 是通道数。alpha / r 才是实际步子大小。
带走:起步 r=32,alpha=64(也就是 2r)。
别和这个混:加大 r 却不改 alpha,等于同时改了两件事。
能用 · 第 5 课
4-bit NormalFloat
专为「权重长得像正态分布」设计的 4-bit 格子。QLoRA 的底座。
记忆钩
不是均匀切 16 格,而是中间密、两边疏——因为权重挤在 0 附近。
带走:QLoRA = NF4 + LoRA。
别和这个混:和 GPTQ / AWQ 不同。NF4 随加载量化;那两个要校准数据。
上机 · 第 0 天
Parameter-Efficient Fine-Tuning
少改参数的微调工具箱。LoRA 是里面最常用的一种。
记忆钩
PEFT 是抽屉,LoRA 是抽屉里那张便签。
带走:课上 from peft import LoraConfig。
别和这个混:PEFT 不是一种算法,是一类方法的库。
上机 · 第 0 天
Transformer Reinforcement Learning
Hugging Face 的训练库。SFT / DPO / GRPO 换个 Trainer 类就能跑。
记忆钩
同一套方向盘,换关卡换 Trainer。
带走:教学和 8B 以下,优先 TRL。
别和这个混:大规模多机用 OpenRLHF / veRL。课上实验用 TRL。
说话 · 第 1 课
LoRA 适配器
训练结束磁盘上留下的小文件,不是一份新的完整模型。
记忆钩
U 盘里只有便签,冰山还在原来的地方。
带走:保存的是 ./qwen3-1.7b-sft,体积远小于 1.7B。
别和这个混:要部署成独立模型,需要 merge 回基座。量化前常常先 merge。
说话 · 第 2 课
Less Is More for Alignment
大约 1000 条精品示范,就能对齐得很像样。质量碾压数量。
记忆钩
一千道精题,好过五万道烂题。
带走:数据脏,算法再新也救不回来。
别和这个混:不是让你永远只用 1K。有干净的 50K 当然更好。
上机 · 第 2 课
训练轮数
整份数据被从头到尾看了几遍。
记忆钩
一遍课本叫 1 个 epoch。高质量数据 1–2 遍就够。
带走:超过 3 遍,多半开始背答案。
别和这个混:step 是走了多少小步;epoch 是看了几遍全书。
上机 · 第 2 课
learning rate
每一步改参数改多大。太大遗忘旧知识,太小学不会新的。
记忆钩
拧水龙头。QLoRA 水要开大一点(1e-4),全参数要小(1e-5)。
带走:它通常比别的超参更敏感。
别和这个混:OOM 时先改 batch / 模型,不要先乱拧学习率。
上机 · 第 2 课
effective batch size
一次真正用来更新的样本数 = 单卡 batch × 累积步数 × GPU 数。
记忆钩
口袋装不下 32 个,就分 8 次攒满再迈一步。
带走:目标 16–32。显存不够用累积,不要把批量砍到 4。
别和这个混:per_device_train_batch_size=4 不是有效批量 4。
选择 · 第 3 课
Direct Preference Optimization 直接偏好优化
给一对回答,告诉模型「左比右好」,直接用分类损失对齐。
记忆钩
SFT 是跟读;DPO 是两个作文里圈更好的那篇。
带走:教选择。跳过奖励模型和 PPO。
别和这个混:没有偏好对就不要上 DPO,更不要上 PPO。
选择 · 第 3 课
chosen / rejected
同一问题下:人选中的回答 vs 落选的回答。
记忆钩
红笔圈出来的,和被叉掉的。
带走:DPO 吃的是成对数据,不是再模仿一遍。
别和这个混:KTO 可以不成对。没成对时别硬上 DPO。
选择 · 第 3 课
KL 温度 / DPO 的刹车
控制新模型和参考模型能离多远。
记忆钩
β 是安全带。DPO 从 0.1 起;SimPO 大约 2.0。
带走:太大不敢动,太小跑飞。
别和这个混:DPO 的 β 和 SimPO 的 β 不是同一个量级。
选择 · 第 3 课
Kullback–Leibler 散度惩罚
不许新模型和原来差太多,防止钻奖励空子、只会套模板。
记忆钩
风筝线。没有线,风筝飞没影。
带走:防奖励黑客、防说胡话。
别和这个混:不是学习率。它管「离参考模型多远」,不管步子大小。
选择 · 第 3 课
πref,通常是 SFT 后冻结的副本
对照用的旧自己。DPO / PPO 用它衡量「你改了多少」。
记忆钩
考试时把上次的答卷钉在桌上,不许离题太远。
带走:TRL 里 ref_model=None,会用初始权重当参考。
别和这个混:SimPO 不需要参考模型,所以更省显存。
选择 · 第 3 课
Simple Preference Optimization
DPO 的省显存亲戚:不用参考模型,用平均 log 概率当隐式奖励。
记忆钩
没安全带也要会选,靠把回答按长度平均。
带走:显存紧、有偏好对时,课上优先考虑。
别和这个混:β 大约 2.0,不要抄 DPO 的 0.1。
选择 · 第 3 课
成对比较模型
「A 比 B 好」的概率,等于两者分数差过一层 sigmoid。
记忆钩
两个人扳手腕,差距越大,赢的越稳。
带走:DPO 的数学起点:人类偏好是比较,不是打绝对分。
别和这个混:不是神经网络结构,是一种比较公式。
思考 · 第 4 课
Reinforcement Learning from Human Feedback
人类先打分或给偏好,再训练奖励模型,再用强化学习挤高分。
记忆钩
SFT 会说话 → 奖励模型当评委 → PPO 当运动员。
带走:流程完整但重:四个模型同时驻场。
别和这个混:DPO 是为了跳过奖励模型和 PPO。GRPO 是为了跳过 critic。
思考 · 第 4 课
Proximal Policy Optimization
经典强化学习算法。更新时把步子夹在一个小区间,免得一次改崩。
记忆钩
每次只准挪一小步,像近端保护。
带走:课上要四个模型:演员、参考、奖励、critic。
别和这个混:GRPO 用一组采样的平均分代替 critic,省大约一半内存。
思考 · 第 4 课
Reward Model
专门给回答打分的模型。PPO 围着它的分数转。
记忆钩
评委。评委有漏洞,运动员就会钻。
带走:这就是奖励黑客的源头。
别和这个混:RLVR 不用它,用对错当奖励。DPO 也不训练它。
思考 · 第 4 课
Group Relative Policy Optimization
同一道题采一组回答,用组内平均分当老师,好的加强、差的压下去。
记忆钩
同桌八个人做同一题,比的是相对高低,不另请评委。
带走:教思考。DeepSeek-R1 这条路上的主力。
别和这个混:必须能自动判对错。闲聊题不要上 GRPO。
思考 · 第 4 课
advantage  = (r − μ) / σ
这个回答比同组平均好多少。正的强化,负的抑制。
记忆钩
不看绝对分,看你有没有高过同桌平均分。
带走:GRPO 用组统计量,不再训练 critic。
别和这个混:序列级优势比较糙,但省掉一个大模型。
思考 · 第 4 课
Reinforcement Learning with Verifiable Rewards
奖励就是对错:数学对了 1,代码测试过了 1,否则 0。
记忆钩
阅卷机器,没有人情分。
带走:干净、无限、难钻空子。
别和这个混:翻译、闲聊不好自动判,就不是 RLVR 的主场。
思考 · 第 4 课
reward hacking
模型学会讨好评分规则,而不是真的变好。
记忆钩
考试只刷选择题技巧,不会解题。
带走:有漏洞的奖励模型最容易被黑。
别和这个混:RLVR 的对错信号很难黑,这是它香的原因。
思考 · 第 4 课
推理能力自己长出来
没人教逐步推理,只给对错,模型自己长出思维链、回溯、顿悟。
记忆钩
R1-Zero:AIME 从 15.6% 到 71%,没有标注思维链。
带走:不是教出来的,是比出来的。
别和这个混:课堂小实验也会弱一些涌现,别拿它和工业级 R1 比惨。
能用 · 第 5 课
Quantization 用更少 bit 存权重
把 16-bit 的权重改写成 8-bit 或 4-bit,显存砍半甚至砍到四分之一。
记忆钩
把精装书印成口袋本。字还在,纸薄了。
带走:PTQ = 训完再压;QAT = 边训边压,用于更狠的 2–3 bit。
别和这个混:不是蒸馏。量化压的是同一个模型;蒸馏是老师教学生。
能用 · 第 5 课
整数量化位宽
用 8 位或 4 位整数代替 16 位浮点来存权重。
记忆钩
8B 模型 FP16 约 16GB;INT8 约 9GB;INT4 大约 5GB。
带走:位宽减半,体积大约减半。
别和这个混:NF4 也是 4-bit,但是按正态分布来切格子,不是普通 INT4。
能用 · 第 5 课
带校准的 4-bit 量化
用一小批真实文本当校准,决定哪些权重更重要,再压到 4-bit。
记忆钩
GPTQ 按层精打细算;AWQ 保护激活大的通道,更快。
带走:生产部署常用 AWQ 或 GPTQ + vLLM。
别和这个混:bitsandbytes 的 NF4 适合训练/调试;上线这两家更常见。
能用 · 第 5 课
Distillation 教师 → 学生
让小模型模仿大模型的作答(尤其是思考过程),用 SFT 来学。
记忆钩
不是压缩体重,是把解题步骤抄给学弟。
带走:R1-Distill-Qwen-1.5B 的 GSM8K 远高于课堂自己 GRPO。
别和这个混:黑盒蒸馏 = 教师文本 + 学生 SFT。不是量化。
能用 · 第 5 课
高速推理引擎
专门把大模型问得快的服务。GRPO 在线采样也可以借它加速。
记忆钩
训练用 TRL,上线用 vLLM。
带走:课上可选。打开能让 GRPO 生成快 2–4 倍。
别和这个混:不是训练器。它不更新权重。
能用 · 第 5 课
llama.cpp 的模型封装
给 CPU / 边缘设备用的模型格式,不一定要大 GPU。
记忆钩
U 盘里能跑的口袋模型。
带走:没 GPU 就走 GGUF,有 GPU 上线走 AWQ+vLLM。
别和这个混:不是训练格式。不要拿 GGUF 去做 SFT。
上机 · 第 0 天
GPU 计算平台
NVIDIA 显卡做深度学习的那套驱动和工具。没有它,torch 看不到 GPU。
记忆钩
nvidia-smi 是体检单:有没有卡、占了多少显存。
带走:绿灯第一步:CUDA 必须亮。
别和这个混:有显卡不等于 CUDA 可用。驱动、镜像、PyTorch 版本都要对上。
上机 · 第 0 天
Out of Memory 显存爆了
GPU 内存不够了。训练直接中断。
记忆钩
行李箱爆了。先换小箱子,再少装,再压薄衣服。
带走:顺序:更小模型 → Unsloth → batch=1 → 缩短序列。
别和这个混:不是代码写错。先别改学习率和算法。
上机 · 第 2 课
用大模型当评委
让一个更强的模型给回答打分,用来评估助手质量。
记忆钩
请学长批改作业。
带走:开放对话很难自动判对错时用它。
别和这个混:数学请用 GSM8K 对答案,不要只靠评委。
上机 · 第 2 课
能力基准测试
固定考卷。GSM8K 是小学数学应用题,MMLU 是多学科选择题。
记忆钩
摸底考试。有标准答案,才能说「进步了」。
带走:第 1 课先用 10 条手工提示;基准是后面的尺子。
别和这个混:训练数据不能掺进考卷,那叫污染。
上机 · 第 0 天
租 GPU 的平台
课程推荐的云 GPU。A100-40G 大约 3.45 元/时,学期大约 100 元。
记忆钩
租卡,不要买卡。训完立刻关机。
带走:镜像:PyTorch 2.3 + Python 3.10 + CUDA 12.1。
别和这个混:系统盘很小。模型和数据集必须放数据盘。