Wall
对照墙
把最容易混的几张表钉在一起:方法怎么选、机器怎么配、超参从哪起手。
你会说话之后,下一步看数据形态
| 局面 | 优先方法 | 为什么 | 别误用 |
|---|---|---|---|
| 只有指令-回复 | SFT / QLoRA | 先建立格式 | 不要指望 SFT 自己对齐偏好 |
| 有成对偏好 | DPO 或 SimPO | 直接教选择 | 回复差距过大时学不到细选择 |
| 只有点赞/点踩 | KTO | unpaired 也能用 | 别硬拼成对 DPO |
| 答案能自动判对错 | GRPO + RLVR | 奖励零噪声 | 闲聊任务没有标准答案 |
| 显存极紧、还想对齐 | SimPO / ORPO | 少载一个参考模型 | β 尺度和 DPO 不同 |
| 要上线、卡不够 | AWQ/GPTQ + vLLM | 换体积和吞吐 | 量化几乎不增加能力 |