术语馆

点开一个词,带走一句人话

每个词四件事:它是什么、怎么记、带走哪一句、别和谁搞混。正文里带点线的词也可以点。已记住 0/45。

先认这 13 个

看钩子猜名字。猜完点开看人话。

说话 · 第 1 课

基座模型

Base Model

只读过海量文本、会续写下一句,但还没学过「你问我答」。

记忆钩

像读完图书馆的人,你一打招呼,他可能接着把目录背下去。

带走:博学,但不听话。

别和这个混:不是 Instruct。Instruct 是后训练过、会按指令回答的版本。

说话 · 第 1 课

Instruct

Instruction-tuned 指令模型

基座经过后训练之后,会听指令、按格式回答的版本。

记忆钩

基座是生米,Instruct 是蒸熟的饭。

带走:课上要你动手训的,常常从 Base 开始,目标是变成 Instruct。

别和这个混:Qwen3-1.7B 和 Qwen3-1.7B-Base 不是同一个。GRPO 实验要用 Base。

说话 · 第 1 课

预训练

Pre-training

在万亿词上预测下一个字,把世界知识压进模型。又贵又慢,这门课不做。

记忆钩

学前班读遍百科。后训练才是上小学学答题。

带走:给知识。后训练给用法。

别和这个混:后训练只占大约 5% 算力,却决定模型能不能当助手。

说话 · 第 1 课

后训练

Post-training

预训练之后:教说话、教选择、教思考,再压缩部署。

记忆钩

四个动词:说话 SFT、选择 DPO、思考 GRPO、能用量化。

带走:这门课的全部地盘。

别和这个混:不是再从头预训练。不要把学习率开到预训练那么大。

说话 · 第 1 课

token

词片段 / 模型的字

模型真正读写的最小块。不一定是一个汉字,可能是半个词。

记忆钩

人看「量子计算」,模型可能看成「量 / 子计 / 算」几块积木。

带走:损失是按 token 算的,不是按句子。

别和这个混:参数量(几十亿)是模型体积;token 是这一次读写的字块。

说话 · 第 1 课

ChatML

对话模板

把 system / user / assistant 角色用特殊标记包起来的对话格式。

记忆钩

像剧本:谁在说,用括号标清楚。标错了,戏就乱。

带走:不要手拼字符串,用 apply_chat_template。

别和这个混:格式错了训练不会报错,模型却会变怪。

说话 · 第 1 课

掩码损失

masked loss,只在 assistant 上算损失

问题不用学,只学「该回答的那几句」。user / system 的字损失记 0。

记忆钩

老师批改只看你的答卷,不把考题抄一遍算分。

带走:只学开口的那一段。

别和这个混:如果整段都算损失,模型会学会复述问题,而不是回答。

说话 · 第 1 课

SFT

Supervised Fine-Tuning 监督微调

拿「问题 → 标准回答」当教材,教模型按格式开口。

记忆钩

S = 标准答案,FT = 再练一遍。跟读课文。

带走:教说话。只会模仿,不会比较好坏。

别和这个混:不是 DPO。SFT 没有「更好/更差」,只有「照着念」。

说话 · 第 1 课

LoRA

Low-Rank Adaptation 低秩适配

原权重冻结,只训练两个瘦小矩阵。改动很小,却能换风格。

记忆钩

冰山不动,只在表面贴一张可撕的便签。

带走:r 是便签厚度。先从 32 试。

别和这个混:不是量化。LoRA 是少训参数;量化是少占显存。

说话 · 第 1 课

QLoRA

Quantized LoRA = NF4 + LoRA

先把基座压成 4-bit,再在上面贴 LoRA。小显存也能微调。

记忆钩

把整座冰山冻瘦,便签还是贴在外面。

带走:课程第一次训练的默认配方。

别和这个混:Q 是量化,不是「更好的 LoRA」。精度换显存。

说话 · 第 2 课

秩 r

LoRA rank

LoRA 那张便签有多厚。越大越能记住新本事,也越容易过拟合。

记忆钩

r 是通道数。alpha / r 才是实际步子大小。

带走:起步 r=32,alpha=64(也就是 2r)。

别和这个混:加大 r 却不改 alpha,等于同时改了两件事。

能用 · 第 5 课

NF4

4-bit NormalFloat

专为「权重长得像正态分布」设计的 4-bit 格子。QLoRA 的底座。

记忆钩

不是均匀切 16 格,而是中间密、两边疏——因为权重挤在 0 附近。

带走:QLoRA = NF4 + LoRA。

别和这个混:和 GPTQ / AWQ 不同。NF4 随加载量化;那两个要校准数据。

上机 · 第 0 天

PEFT

Parameter-Efficient Fine-Tuning

少改参数的微调工具箱。LoRA 是里面最常用的一种。

记忆钩

PEFT 是抽屉,LoRA 是抽屉里那张便签。

带走:课上 from peft import LoraConfig。

别和这个混:PEFT 不是一种算法,是一类方法的库。

上机 · 第 0 天

TRL

Transformer Reinforcement Learning

Hugging Face 的训练库。SFT / DPO / GRPO 换个 Trainer 类就能跑。

记忆钩

同一套方向盘,换关卡换 Trainer。

带走:教学和 8B 以下,优先 TRL。

别和这个混:大规模多机用 OpenRLHF / veRL。课上实验用 TRL。

说话 · 第 1 课

adapter

LoRA 适配器

训练结束磁盘上留下的小文件,不是一份新的完整模型。

记忆钩

U 盘里只有便签,冰山还在原来的地方。

带走:保存的是 ./qwen3-1.7b-sft,体积远小于 1.7B。

别和这个混:要部署成独立模型,需要 merge 回基座。量化前常常先 merge。

说话 · 第 2 课

LIMA

Less Is More for Alignment

大约 1000 条精品示范,就能对齐得很像样。质量碾压数量。

记忆钩

一千道精题,好过五万道烂题。

带走:数据脏,算法再新也救不回来。

别和这个混:不是让你永远只用 1K。有干净的 50K 当然更好。

上机 · 第 2 课

epoch

训练轮数

整份数据被从头到尾看了几遍。

记忆钩

一遍课本叫 1 个 epoch。高质量数据 1–2 遍就够。

带走:超过 3 遍,多半开始背答案。

别和这个混:step 是走了多少小步;epoch 是看了几遍全书。

上机 · 第 2 课

学习率

learning rate

每一步改参数改多大。太大遗忘旧知识,太小学不会新的。

记忆钩

拧水龙头。QLoRA 水要开大一点(1e-4),全参数要小(1e-5)。

带走:它通常比别的超参更敏感。

别和这个混:OOM 时先改 batch / 模型,不要先乱拧学习率。

上机 · 第 2 课

有效批量

effective batch size

一次真正用来更新的样本数 = 单卡 batch × 累积步数 × GPU 数。

记忆钩

口袋装不下 32 个,就分 8 次攒满再迈一步。

带走:目标 16–32。显存不够用累积,不要把批量砍到 4。

别和这个混:per_device_train_batch_size=4 不是有效批量 4。

选择 · 第 3 课

DPO

Direct Preference Optimization 直接偏好优化

给一对回答,告诉模型「左比右好」,直接用分类损失对齐。

记忆钩

SFT 是跟读;DPO 是两个作文里圈更好的那篇。

带走:教选择。跳过奖励模型和 PPO。

别和这个混:没有偏好对就不要上 DPO,更不要上 PPO。

选择 · 第 3 课

偏好对

chosen / rejected

同一问题下:人选中的回答 vs 落选的回答。

记忆钩

红笔圈出来的,和被叉掉的。

带走:DPO 吃的是成对数据,不是再模仿一遍。

别和这个混:KTO 可以不成对。没成对时别硬上 DPO。

选择 · 第 3 课

β

KL 温度 / DPO 的刹车

控制新模型和参考模型能离多远。

记忆钩

β 是安全带。DPO 从 0.1 起;SimPO 大约 2.0。

带走:太大不敢动,太小跑飞。

别和这个混:DPO 的 β 和 SimPO 的 β 不是同一个量级。

选择 · 第 3 课

KL 约束

Kullback–Leibler 散度惩罚

不许新模型和原来差太多,防止钻奖励空子、只会套模板。

记忆钩

风筝线。没有线,风筝飞没影。

带走:防奖励黑客、防说胡话。

别和这个混:不是学习率。它管「离参考模型多远」,不管步子大小。

选择 · 第 3 课

参考模型

πref,通常是 SFT 后冻结的副本

对照用的旧自己。DPO / PPO 用它衡量「你改了多少」。

记忆钩

考试时把上次的答卷钉在桌上,不许离题太远。

带走:TRL 里 ref_model=None,会用初始权重当参考。

别和这个混:SimPO 不需要参考模型,所以更省显存。

选择 · 第 3 课

SimPO

Simple Preference Optimization

DPO 的省显存亲戚:不用参考模型,用平均 log 概率当隐式奖励。

记忆钩

没安全带也要会选,靠把回答按长度平均。

带走:显存紧、有偏好对时,课上优先考虑。

别和这个混:β 大约 2.0,不要抄 DPO 的 0.1。

选择 · 第 3 课

Bradley-Terry

成对比较模型

「A 比 B 好」的概率,等于两者分数差过一层 sigmoid。

记忆钩

两个人扳手腕,差距越大,赢的越稳。

带走:DPO 的数学起点:人类偏好是比较,不是打绝对分。

别和这个混:不是神经网络结构,是一种比较公式。

思考 · 第 4 课

RLHF

Reinforcement Learning from Human Feedback

人类先打分或给偏好,再训练奖励模型,再用强化学习挤高分。

记忆钩

SFT 会说话 → 奖励模型当评委 → PPO 当运动员。

带走:流程完整但重:四个模型同时驻场。

别和这个混:DPO 是为了跳过奖励模型和 PPO。GRPO 是为了跳过 critic。

思考 · 第 4 课

PPO

Proximal Policy Optimization

经典强化学习算法。更新时把步子夹在一个小区间,免得一次改崩。

记忆钩

每次只准挪一小步,像近端保护。

带走:课上要四个模型:演员、参考、奖励、critic。

别和这个混:GRPO 用一组采样的平均分代替 critic,省大约一半内存。

思考 · 第 4 课

奖励模型

Reward Model

专门给回答打分的模型。PPO 围着它的分数转。

记忆钩

评委。评委有漏洞,运动员就会钻。

带走:这就是奖励黑客的源头。

别和这个混:RLVR 不用它,用对错当奖励。DPO 也不训练它。

思考 · 第 4 课

GRPO

Group Relative Policy Optimization

同一道题采一组回答,用组内平均分当老师,好的加强、差的压下去。

记忆钩

同桌八个人做同一题,比的是相对高低,不另请评委。

带走:教思考。DeepSeek-R1 这条路上的主力。

别和这个混:必须能自动判对错。闲聊题不要上 GRPO。

思考 · 第 4 课

优势

advantage  = (r − μ) / σ

这个回答比同组平均好多少。正的强化,负的抑制。

记忆钩

不看绝对分,看你有没有高过同桌平均分。

带走:GRPO 用组统计量,不再训练 critic。

别和这个混:序列级优势比较糙,但省掉一个大模型。

思考 · 第 4 课

RLVR

Reinforcement Learning with Verifiable Rewards

奖励就是对错:数学对了 1,代码测试过了 1,否则 0。

记忆钩

阅卷机器,没有人情分。

带走:干净、无限、难钻空子。

别和这个混:翻译、闲聊不好自动判,就不是 RLVR 的主场。

思考 · 第 4 课

奖励黑客

reward hacking

模型学会讨好评分规则,而不是真的变好。

记忆钩

考试只刷选择题技巧,不会解题。

带走:有漏洞的奖励模型最容易被黑。

别和这个混:RLVR 的对错信号很难黑,这是它香的原因。

思考 · 第 4 课

涌现

推理能力自己长出来

没人教逐步推理,只给对错,模型自己长出思维链、回溯、顿悟。

记忆钩

R1-Zero:AIME 从 15.6% 到 71%,没有标注思维链。

带走:不是教出来的,是比出来的。

别和这个混:课堂小实验也会弱一些涌现,别拿它和工业级 R1 比惨。

能用 · 第 5 课

量化

Quantization 用更少 bit 存权重

把 16-bit 的权重改写成 8-bit 或 4-bit,显存砍半甚至砍到四分之一。

记忆钩

把精装书印成口袋本。字还在,纸薄了。

带走:PTQ = 训完再压;QAT = 边训边压,用于更狠的 2–3 bit。

别和这个混:不是蒸馏。量化压的是同一个模型;蒸馏是老师教学生。

能用 · 第 5 课

INT8 / INT4

整数量化位宽

用 8 位或 4 位整数代替 16 位浮点来存权重。

记忆钩

8B 模型 FP16 约 16GB;INT8 约 9GB;INT4 大约 5GB。

带走:位宽减半,体积大约减半。

别和这个混:NF4 也是 4-bit,但是按正态分布来切格子,不是普通 INT4。

能用 · 第 5 课

GPTQ / AWQ

带校准的 4-bit 量化

用一小批真实文本当校准,决定哪些权重更重要,再压到 4-bit。

记忆钩

GPTQ 按层精打细算;AWQ 保护激活大的通道,更快。

带走:生产部署常用 AWQ 或 GPTQ + vLLM。

别和这个混:bitsandbytes 的 NF4 适合训练/调试;上线这两家更常见。

能用 · 第 5 课

蒸馏

Distillation 教师 → 学生

让小模型模仿大模型的作答(尤其是思考过程),用 SFT 来学。

记忆钩

不是压缩体重,是把解题步骤抄给学弟。

带走:R1-Distill-Qwen-1.5B 的 GSM8K 远高于课堂自己 GRPO。

别和这个混:黑盒蒸馏 = 教师文本 + 学生 SFT。不是量化。

能用 · 第 5 课

vLLM

高速推理引擎

专门把大模型问得快的服务。GRPO 在线采样也可以借它加速。

记忆钩

训练用 TRL,上线用 vLLM。

带走:课上可选。打开能让 GRPO 生成快 2–4 倍。

别和这个混:不是训练器。它不更新权重。

能用 · 第 5 课

GGUF

llama.cpp 的模型封装

给 CPU / 边缘设备用的模型格式,不一定要大 GPU。

记忆钩

U 盘里能跑的口袋模型。

带走:没 GPU 就走 GGUF,有 GPU 上线走 AWQ+vLLM。

别和这个混:不是训练格式。不要拿 GGUF 去做 SFT。

上机 · 第 0 天

CUDA

GPU 计算平台

NVIDIA 显卡做深度学习的那套驱动和工具。没有它,torch 看不到 GPU。

记忆钩

nvidia-smi 是体检单:有没有卡、占了多少显存。

带走:绿灯第一步:CUDA 必须亮。

别和这个混:有显卡不等于 CUDA 可用。驱动、镜像、PyTorch 版本都要对上。

上机 · 第 0 天

OOM

Out of Memory 显存爆了

GPU 内存不够了。训练直接中断。

记忆钩

行李箱爆了。先换小箱子,再少装,再压薄衣服。

带走:顺序:更小模型 → Unsloth → batch=1 → 缩短序列。

别和这个混:不是代码写错。先别改学习率和算法。

上机 · 第 2 课

LLM-as-Judge

用大模型当评委

让一个更强的模型给回答打分,用来评估助手质量。

记忆钩

请学长批改作业。

带走:开放对话很难自动判对错时用它。

别和这个混:数学请用 GSM8K 对答案,不要只靠评委。

上机 · 第 2 课

GSM8K / MMLU

能力基准测试

固定考卷。GSM8K 是小学数学应用题,MMLU 是多学科选择题。

记忆钩

摸底考试。有标准答案,才能说「进步了」。

带走:第 1 课先用 10 条手工提示;基准是后面的尺子。

别和这个混:训练数据不能掺进考卷,那叫污染。

上机 · 第 0 天

AutoDL

租 GPU 的平台

课程推荐的云 GPU。A100-40G 大约 3.45 元/时,学期大约 100 元。

记忆钩

租卡,不要买卡。训完立刻关机。

带走:镜像:PyTorch 2.3 + Python 3.10 + CUDA 12.1。

别和这个混:系统盘很小。模型和数据集必须放数据盘。