4 章 · 微调与对齐

12 道。

Q4-01
SFT、RLHF、DPO 分别在做什么?用一条主线把后训练串起来
后训练主线高频
Q4-02
DPO 为什么能绕开奖励模型?和 RLHF/PPO 比有什么取舍?
偏好对齐常见
Q4-03
GRPO 是什么?为什么推理模型训练里常见?
强化学习后训练进阶
Q4-04
LoRA 的原理是什么?为什么加两个低秩矩阵就能微调?
参数高效微调高频
Q4-05
LoRA 的 r 和 alpha 怎么设?QLoRA 又省在哪?
参数高效微调常见
Q4-06
微调 7B 模型,全参和 LoRA 各要多少显存?怎么估算?
训练资源估算常见
Q4-07
什么问题该微调、什么问题该 RAG、什么问题写好 prompt 就够了?
技术选型判断高频
Q4-08
基座模型半年一大版,你去年微调的模型还有价值吗?微调的护城河在哪?
技术投资判断高频
Q4-09
微调数据从哪来?怎么保证质量?多少条够?
训练数据工程高频
Q4-10
什么是蒸馏?用大模型造数据训小模型要注意什么(含合规)?
知识蒸馏与合规常见
Q4-11
微调后"学会了新任务但变笨了"怎么办?
微调副作用常见
Q4-12
你简历里那次微调,效果提升怎么量化的?和 few-shot 基线比过吗?
项目深挖高频