INT8
LLM.int8()
异常值通道留 FP16,其余 。质量几乎不掉,显存约减半。适合调试。
第 05 课 · 让它能用
训好不等于能上线。换显存,换能力,多模态和工具换技能边界。
Archify · architecture
你只通过 Jupyter 碰那张 A100,训练发生在 GPU 上。
标准配置
三个库各管一段
磁盘纪律
FP16 权重大小
FORMULA
权重 ≈ 2 × N bytes (N 为参数量)
Qwen3-8B → 约 16GB 权重。推理还要加 KV cache、激活、框架开销,合计约 20–22GB。
压缩比 ≈ 原位数 / 目标位数。16→8 约一半,16→4 约四分之一。质量损失要另外测。
模型参数量
8B
滑到 1.7 或 8,对照课程里的两档。
| 精度 | 约权重 | 约推理合计 | 16GB 卡 |
|---|---|---|---|
| FP16 | 16.0 GB | 21.0 GB | 偏紧 |
| INT8 | 8.0 GB | 12.0 GB | 可能够 |
| NF4 | 4.5 GB | 8.0 GB | 可能够 |
| GPTQ/AWQ Int4 | 4.0 GB | 7.2 GB | 可能够 |
8B FP16 权重约 16GB、推理约 20–22GB;INT8 约 9GB;NF4 约 5.5GB。表内合计含粗算 KV/框架,便于建立数量级,不是厂商官方数字。
INT8
异常值通道留 FP16,其余 。质量几乎不掉,显存约减半。适合调试。
NF4
权重近似正态分布,按分位数分成 16 档。再对缩放因子做双重。训练友好。
GPTQ
用校准数据让 WX ≈ ŴX。上线常见。group size 常 128。
AWQ
激活大的权重少一点。与 搭配是常见生产路径。
小模型自己 RL 往往不够
课堂里小模型直接 大约 55% 量级。教师已经「想过」的轨迹,是更稠密的监督。对小团队,常常比从零 RL 更划算。
看
两阶段:先冻住 LLM 与 ViT,只训投影层;再 语言模型。先接通,再变好。
做
函数调用是结构化输出。用 JSON Schema + 约束解码,比指望模型自由发挥可靠。
记
改权重适合改一两件事实;知识常变、要可追溯,用检索。多数产品先 RAG。
第 5 课
权重从 16bit 压到约 4bit。
第 5 课
老师写解题过程,学生做 SFT。