Check

十一道小题,检验有没有真懂

每题只考一个直觉。做错也没关系,解释就写在选项下面。已答 0 / 11,答对 0。

01 后训练概述与 SFT

回看海报

第 1 课

后训练大约只占预训练算力的 5%,为什么还说它决定了模型能不能用?

想想基座模型会什么、不会什么。

第 1 课

SFT 为什么只在 assistant 的 token 上算损失?

推理时用户的问题是给定的。

02 SFT 进阶:数据工程

回看海报

第 2 课

LIMA 用 1,000 条精选数据,效果接近当时用 5 万条训练的模型。这说明什么?

表层对齐假说。

第 2 课

同样做 LoRA,学习率该怎么选?

QLoRA 通常要更大。

03 偏好对齐:DPO 家族

回看海报

第 3 课

DPO 相对经典 RLHF + PPO,最关键的简化是什么?

它直接在偏好对上训练。

第 3 课

β 太大或太小会怎样?

它控制「离参考模型有多远」。

04 RLHF 与 GRPO

回看海报

第 4 课

GRPO 为什么能砍掉 PPO 里的 Critic(价值网络)?

Group Relative 这四个字。

第 4 课

DeepSeek-R1-Zero 最让人惊讶的一点是?

它几乎没做 SFT。

05 压缩、蒸馏与扩展

回看海报

第 5 课

Qwen3-8B 用 FP16 推理大约要 20–22GB。改成 NF4 大约多少?

权重从 16bit 压到约 4bit。

第 5 课

想把大模型的推理能力搬到小模型,最常见的做法是?

老师写解题过程,学生做 SFT。

06 项目、图谱与你的方法

回看海报

第 6 课

如果任务是「数学答案对不对」且可以自动判分,优先选哪条路?

可验证奖励。