微调与对齐
后训练三档、LoRA 与显存账、什么时候该微调、微调完为什么变笨。 共 11 个知识点,对应题库第 4 章。
进阶5 个
后训练的三档由监督信号的形态决定:SFT 用「正确答案」、RLHF / DPO 用「哪个更好」的偏好对、 GRPO 用可验证的奖励。信号越弱越便宜、越难标,能走到哪一档取决于你拿得到哪种信号,而不是取决于算法新旧。
数据构造四步:定判准、采集与清洗、标注与去重、切出评测集。质量比数量重要 —— 几百条高质量样本常胜过几万条噪声;数据量经验区间按任务类型分档。评测集必须在标注前切开,否则「效果提升」是泄漏出来的。
LoRA 冻结原权重,在旁边加一对低秩矩阵 A·B 学增量:微调时只训这几百万参数,推理时可以合并回原权重不增加延迟。能成立的前提是权重更新本身低秩 —— 这也是它在「教格式、教风格」上好用、在「灌新知识」上乏力的原因。
先问三个问题:缺的是知识还是行为、知识变不变、行为能不能用 prompt 和结构化输出表达。缺知识且会变 → RAG;缺行为且 prompt 表达不了 → 微调;其余写好 prompt 就够。四条路的成本量级差一到两个数量级,2026 年错误的微调理由有三个。
蒸馏是用大模型造数据训小模型:技术侧靠合成数据、拒绝采样筛出高质量样本;合规侧要看教师模型的服务条款 —— 多数闭源厂商禁止用输出训练竞品模型。能不能蒸、蒸谁的,先看条款再看效果。
深水6 个
RLHF 要四步四个模型:先训奖励模型再用 PPO 优化策略,KL 约束防跑偏。DPO 把奖励模型隐式写进损失函数,直接在偏好对上优化,省掉了奖励模型与 RL 训练的不稳定;代价是离线数据一旦分布偏了没有在线纠正的机会。
显存三档账:权重 + 梯度 + 优化器状态 + 激活。全参微调 7B 光优化器状态就是权重的两倍以上, LoRA 把梯度与优化器状态压到可训参数那一小份,QLoRA 再把权重压到 4 bit;激活随 batch 与序列长度涨,梯度检查点拿算力换显存。
「学会了新任务但变笨了」是灾难性遗忘:新数据把承载通用能力的权重推走了。缓解靠复演(rehearsal,混入通用数据)、更小的学习率与 LoRA 这类限制更新范围的方法;训练监控必须同时跑通用基准,只看任务指标发现不了。
r 定低秩矩阵的秩、alpha 定增量的缩放,两套常见数字(r=8/alpha=16 与 r=64/alpha=128)其实不矛盾 —— 看的是 alpha/r 的比值与任务复杂度。QLoRA 把冻结的基座量化到 NF4 省显存,训练的 LoRA 部分仍是全精度,省的是基座那份不是梯度那份。
GRPO 把 PPO 里的 critic 换成「同一题多次采样的平均分」做基线,省掉一个模型;配合可验证奖励(RLVR:数学能对答案、代码能跑测试),奖励不再靠人标。这就是推理模型训练里它常见的原因 —— 推理任务恰好有可验证的对错。
基座半年一大版,微调被吃掉了三块半:通用能力、格式遵循、长上下文、大半的领域知识。剩下的四条护城河是私有数据分布、延迟与成本敏感的小模型、稳定的行为约束、离线可控。资产寿命是最容易被忽略的判据 —— 微调产物的折旧速度决定它值不值得投。