MAGPIE
- 不需要种子
- 一次前向就能吐指令
- 多样性高
- 成本低
第 02 课 · 选对教材
算法往往不是瓶颈。去重、去污染、难度配比和超参,决定 的天花板。
Archify · dataflow
原始 alpaca 必须变成 role/content 列表,SFTTrainer 才认。
原始
清洗
格式
训练
产出
alpaca_gpt4_zh
指令对
第 1 课
质量过滤
短回复丢掉
>30 字
划分
95 / 5
seed=42
messages
role + content
唯一保留列
ChatML
Qwen 模板
掩码损失
只学 assistant
SFT 核心
SFTTrainer
QLoRA 一步
TRL
LoRA adapter
约 2% 参数
可接着 DPO
10 条人工看
对照基座
SFTTrainer 认什么
掩码一旦错
Self-Instruct
175 条人工种子,让模型扩写成任务。Alpaca 的 52K 就走这条路。多样性受种子限制。
UltraChat
规模来到百万级多轮对话,200K 精简版常被教学使用。质量靠后续过滤。
MAGPIE
不对齐种子。只把 <|im_start|>user\n 喂给已经对齐的模型,让它自己补全一条指令,再回答。快、便宜、多样性来自模型自身分布。
去重
精确匹配 → n-gram / MinHash 近重复 → 嵌入相似度。重复会让风格塌缩。
去污染
对 、、、IFEval 做重叠检查。否则分数是背题,不是学会。
难度
太易无效,太难学不会。按难度分层,保证各档都有。
开源黄金标准不是单一领域堆料,而是有意识的混合。拖动看「偏科」时缺了什么。
Tülu 3 的大致配比。总和不必精确 100,看相对比例。偏科时海报会提醒你。
配比接近开源实践:通用打底,数学/代码/安全各占一席。
学习率(最敏感的旋钮)
| 方法 | 推荐范围 | 备注 |
|---|---|---|
| 全参数 | 1e-5 ~ 5e-5 | 偏小更安全,防灾难性遗忘 |
| 1e-5 ~ 5e-5 | 与全参类似 | |
| 1e-4 ~ 3e-4 | 后通常要更大 |
cosine 调度 + warmup 占 10%。对最终性能的影响超过其他单一超参。
批量、轮数、长度、LoRA
| 旋钮 | 建议 | 原因 |
|---|---|---|
| 16~32 | 4~8 太吵,64+ 可能要配更大 LR | |
| Epoch | 高质量 1~2 | >3 轮几乎总会过拟合 |
| 序列长度 | 覆盖 95% 数据 | 显存 ∝ batch × 长度² |
| r | 16~64,起手 32 | α=2r,目标尽量全部线性层 |
| dropout | 0.05~0.1 | 数据少时调高 |
开放生成怎么打分
数学可以对错,写作只能比较。 用固定量规给有用性、准确性、简洁、安全打分。它快,但会偏爱更长、更谄媚的回复——所以抽 20 条人工复看。
第 2 课
表层对齐假说。
第 2 课
QLoRA 通常要更大。