微调类项目拷打追问链
结构:七步拷打路径(动机 → 基线 → 数据 → 超参 → 评测 → 上线 → 压力),按三段推进
第一段 · 卡动机(第 1–2 步)
拷问 1这个问题为什么必须微调?写不出规则、还是给不了例子?
期望要点:微调的入场券只有一句话——「你写不出这条规则,只能给例子」。合格的动机长这样:领域内的输出风格/判准是隐性的,人能一眼分辨好坏但写不成提示词;或者要把大模型的能力压进小模型降本;或者数据不能出网只能自己练。
加分:主动用三问决策树自证——不知道 → 该 RAG;不会做 → 先提 effort 档位和改提示词,还不行才 SFT,有可验证奖励才谈强化;太贵太慢 → 蒸馏。能说清自己落在哪一支且为什么不落在别支的,是真做过选型。
判别信号:答「为了让模型更懂我们的业务知识」的,是把知识注入当微调理由——这一支应该走 RAG,因为知识会更新而权重会过期。这一问答砸,后面基本可以只走第三段。
分叉:动机是「压成本」→ 直接跳到蒸馏线(教师模型、数据合规、小模型选型、省了多少);动机是「隐性判准」→ 走完整七步。
拷问 2不微调的基线是多少?和 few-shot 比过吗?
期望要点:必须有基线数字,而且基线必须是认真调过的提示词 + few-shot,不是随手写的一句话。合格的回答会说清:基线用的哪个模型、什么档位、几个示例、评测集多少条、得分多少。
判别信号:这是整条链的主分水岭。没和 few-shot 基线比过的微调项目,无法证明微调本身有价值——很多「微调提升 20%」的真相是「原来的提示词写得太差」。答不出基线的,分数压到及格线以下。
分叉:报了提升幅度 → 立刻追基线多少、样本多少、置信区间多宽(n=100、基线 80% 时 95% 置信区间约 ±7.8 个百分点;采样参数退场后还要同配置重跑几次报方差)。
第二段 · 要过程(第 3–5 步)
拷问 3训练数据从哪来?多少条?怎么保证质量?
期望要点:能讲出具体的获取与清洗动作:来源(线上日志、人工标注、大模型合成、开源集)、去重、去噪、长度分布、以及标注一致性怎么保证(多人标注的一致率、分歧怎么裁决)。数量上要能说出为什么是这个量级,以及是先小规模验证再扩量,还是一次到位。
加分:说得出「数据质量比数量重要」的具体证据——比如砍掉一批低质样本后指标反而上升。
判别信号:能说「我们先用几百条跑通链路,确认有效后再扩」的,流程是对的;只说「用了 XX 万条」的,往下追清洗过程通常就空。
分叉:提到用大模型造数据 → 追合规(教师模型的服务条款是否允许蒸馏输出用于训练竞品)、同质化(合成数据分布过窄导致过拟合)、教师错误被继承。
拷问 4LoRA 的秩和缩放系数怎么定的?加在哪些层?
期望要点:2026 年的共识要能说出来:加在所有线性层(不只是注意力的查询和值投影);学习率大致是全参微调的十倍量级;有效批量不要太大。秩和缩放系数要说清是怎么试出来的(从小开始、看是否欠拟合再加),而不是报一个数字说「常用值」。
判别信号:只说「加在 q_proj 和 v_proj」的是化石答案——那是 2023 年的做法,说明知识没更新。能说「一开始只加注意力层效果不行,改成全线性层就上来了」的,是自己跑过。
分叉:提到量化版 LoRA → 追它省在哪(基座权重量化存储,训练时反量化计算)、代价是什么(吞吐下降、极低比特下有精度损失)。提到直接偏好优化 → 追它为什么能绕开奖励模型、和策略优化比取舍在哪。
拷问 5显存怎么估的?跑在什么卡上、跑了多久?
期望要点:能给估算逻辑而不是背结论:参数、梯度、优化器状态、激活各占多少,全参和低秩微调的差别在哪一项上。以及真实的工程细节:卡型、批量、序列长度、梯度累积、跑了多少小时。
判别信号:这一问是低成本的真实性验证——真跑过的人对「跑了多久、爆没爆显存、怎么解决的」有肌肉记忆,编的人只能给理论值。
拷问 6怎么评测的?除了任务指标,有没有测「别的能力有没有变差」?
期望要点:两件事都要有。① 任务指标:评测集从哪来、和基线怎么比、过没过统计关。② 回归测试:微调后通用能力有没有退化。要能说出灾难性遗忘的交易判据——目标任务提升有限、而其他能力明显下降时,这笔交易就不划算;实践里的粗判是「任务好一成、其他差两成半」就该重新考虑。
加分:说得出评测集是唯一 100% 保值的资产——基座换代后微调权重归零、提示词和索引部分保值,只有评测集完全保值。所以评测集应该第一天就建。
判别信号:只测目标任务的,上线后大概率被通用能力退化反噬;能主动说「我们留了一批通用能力回归题」的,吃过亏或者被教过。
第三段 · 压「今天还会不会这么做」(第 6–7 步)
拷问 7怎么上线的?灰度、回滚、以及基座升级怎么办?
期望要点:上线部分要能说清:灰度比例与观察指标、回滚路径(能不能秒切回基座 + 提示词方案)、推理侧怎么部署(合并权重还是挂适配器,两者在多租户下的差别)。基座升级是这一问的重点——基座换代后原权重不可用,要重训;所以要看当初有没有把数据流水线和评测集沉淀成可复用资产,还是一次性手工搞完就散了。
判别信号:能说「我们把训练数据的清洗脚本和评测集固化下来了,换基座重跑一遍是两天的事」的,是有资产意识的;答「换了基座就得从头再来一遍」的,说明当时是一次性项目。
拷问 8放到今天,你还会微调吗?
期望要点:这是灵魂问的正面形态。合格的回答要正视微调的三面挤压:知识注入被检索接走、格式约束被结构化输出接走、推理深度被推理档位接走。然后给出今天仍然成立的护城河:把大模型能力蒸馏进小模型压成本、有可验证奖励信号的强化训练、写不出来的隐性判准、以及数据主权(不能出网)。
判别信号:全盘否定「现在不需要微调了」的,走了另一个极端;能说「知识那部分我今天会改成检索,但风格判准那部分我还是会微调」的,判断力在线。
拷问 9这个项目最大的遗憾是什么?
期望要点:诚实度题。微调项目常见的真实遗憾:评测集建晚了、没和 few-shot 基线比过所以说不清价值、数据清洗全靠手工没沉淀成流水线、基座升级后成果归零。
这份模板怎么用
七步拷打路径总览
① 动机 ─→ ② 基线 ─→ ③ 数据 ─→ ④ 超参 ─→ ⑤ 评测 ─→ ⑥ 上线 ─→ ⑦ 压力 为什么 不微调 从哪来 怎么定 和谁比 怎么发 今天还会 要练 能到多少 怎么洗 试过啥 过关没 怎么退 这么做吗 └── 第一段 ──┘ └────── 第二段 ──────┘ └─ 第三段 ─┘
三段推进的强度递增:第一段答砸可以提前结束(说明是跟风微调),第二段决定基础分,第三段决定他今天的判断力还在不在线。
灵魂反问:为什么不用 RAG?
这一问可以插在任何位置,尤其适合在候选人讲得最流畅的时候打断:
- 第一层:「你这个需求,用检索把资料塞进去不行吗?」
- 第二层(答「知识太多塞不下」):「那是检索做得不好,不是必须微调的理由——你们试过分块和重排吗?」
- 第三层(答「要模型学会我们的风格」):「风格能不能用几个例子演示?如果能,为什么不用 few-shot?」
- 第四层(答「few-shot 占上下文太贵」):「那这是成本问题不是能力问题——你算过微调的训练加维护成本能不能摊平吗?基座半年一换呢?」
- 第五层(压力):「如果我现在告诉你预算只够做一件事,你选微调还是选把检索和评测做扎实?为什么?」
合格的落点:能在某一层坦然承认「这一层确实检索能解决,我们当时微调的真正理由只有隐性判准这一条」。能把自己的动机收窄到一条并守住的人,比一路辩护的人可信得多。
分叉路径速查
| 候选人说 | 立刻追什么 |
|---|---|
| 「用 LoRA 微调了 7B」 | 加在哪些层?学习率相对全参怎么设?有效批量多大? |
| 「只加了 q_proj / v_proj」 | 这是化石配置——问他试没试过全线性层,结果差多少 |
| 「效果提升了 X%」 | 基线是什么?调过的提示词还是随手写的?样本量和置信区间? |
| 「用了 DPO」 | 为什么能绕开奖励模型?和策略优化比取舍在哪?偏好数据怎么造的? |
| 「用大模型造了训练数据」 | 服务条款允许吗?同质化怎么防?教师的错误怎么筛? |
| 「蒸馏了一个小模型」 | 省了多少?延迟降了多少?教师和学生的差距在哪类样本上最大? |
| 「微调后效果很好」 | 通用能力测了吗?回归集有多少条? |
| 「基座升级了」 | 重训成本多少?数据流水线和评测集复用了吗? |
排障分支:固定住一个变量,把问题一分为二
微调项目的排障同样统一到这一句:
固定「文档」 → 切开 检索侧 / 生成侧 (若方案里含检索) 固定「输入」 → 切开 流量侧 / 系统侧 (金丝雀集,线上突然变差) 固定「模型段」 → 切开 模型侧 / 链路侧 (延迟变高) 固定「token 类别」 → 切开 输入侧 / 输出侧 (成本变高) 固定「变更集」 → 切开 变更侧 / 环境侧 (上线后出事故)
微调专属再加一刀:固定「模型版本」——同一批输入分别过基座 + 提示词、和微调后模型,切开「是微调带来的退化」还是「是数据/链路本身的问题」。这一刀不切,微调项目的锅经常背错。
危险信号清单
出现下列任意两条,基本可以判定项目虚高:
- 动机是「让模型学会我们的业务知识」(这一支应该走检索)
- 没和调过的 few-shot 基线比过
- 报了提升幅度但说不出基线、样本量、置信区间
- 超参全是「常用值」,说不出试过什么
- 只加注意力的查询和值投影,且不知道这已经过时
- 说不出跑在什么卡上、跑了多久、有没有爆显存
- 只测目标任务,没有通用能力回归
- 说不出基座升级后怎么办
- 面对「为什么不用 RAG」全程辩护,一层都不肯让
判分档位
| 档位 | 画像 |
|---|---|
| 60 分 | 说得清 SFT/DPO/LoRA 的原理,但没有基线、没有回归测试、超参说不出来由。跑过训练脚本。 |
| 75 分 | 有 few-shot 基线、有评测集、有通用能力回归,超参能说出试错过程,显存和工时是真实的。独立完成过一次微调落地。 |
| 90 分 | 上面全有,且:动机能收窄到三面挤压之后仍成立的那一条;报数字时主动给样本量和统计口径;把数据流水线与评测集当作资产沉淀;被问「今天还会不会这么做」时能分开说哪部分改走检索、哪部分仍然微调。做过,且知道微调今天的边界在哪。 |