第 4 章 · 微调与对齐
共 12 道。
Q4-01
SFT、RLHF、DPO 分别在做什么?用一条主线把后训练串起来
Q4-02
DPO 为什么能绕开奖励模型?和 RLHF/PPO 比有什么取舍?
Q4-03
GRPO 是什么?为什么推理模型训练里常见?
Q4-04
LoRA 的原理是什么?为什么加两个低秩矩阵就能微调?
Q4-05
LoRA 的 r 和 alpha 怎么设?QLoRA 又省在哪?
Q4-06
微调 7B 模型,全参和 LoRA 各要多少显存?怎么估算?
Q4-07
什么问题该微调、什么问题该 RAG、什么问题写好 prompt 就够了?
Q4-08
基座模型半年一大版,你去年微调的模型还有价值吗?微调的护城河在哪?
Q4-09
微调数据从哪来?怎么保证质量?多少条够?
Q4-10
什么是蒸馏?用大模型造数据训小模型要注意什么(含合规)?
Q4-11
微调后"学会了新任务但变笨了"怎么办?
Q4-12
你简历里那次微调,效果提升怎么量化的?和 few-shot 基线比过吗?