Wall

对照墙

把最容易混的几张表钉在一起:方法怎么选、机器怎么配、超参从哪起手。

你会说话之后,下一步看数据形态

局面优先方法为什么别误用
只有指令-回复SFT / QLoRA先建立格式不要指望 SFT 自己对齐偏好
有成对偏好DPO 或 SimPO直接教选择回复差距过大时学不到细选择
只有点赞/点踩KTO unpaired 也能用别硬拼成对 DPO
答案能自动判对错GRPO + RLVR奖励零噪声闲聊任务没有标准答案
显存极紧、还想对齐SimPO / ORPO少载一个参考模型β 尺度和 DPO 不同
要上线、卡不够AWQ/GPTQ + vLLM换体积和吞吐量化几乎不增加能力