微调类项目拷打追问链

P3微调类项目深度 5 层更新于 2026-08-20

结构:七步拷打路径(动机 → 基线 → 数据 → 超参 → 评测 → 上线 → 压力),按三段推进

第一段 · 卡动机(第 1–2 步)

拷问 1这个问题为什么必须微调?写不出规则、还是给不了例子?

期望要点:微调的入场券只有一句话——「你写不出这条规则,只能给例子」。合格的动机长这样:领域内的输出风格/判准是隐性的,人能一眼分辨好坏但写不成提示词;或者要把大模型的能力压进小模型降本;或者数据不能出网只能自己练。

加分:主动用三问决策树自证——不知道 → 该 RAG;不会做 → 先提 effort 档位和改提示词,还不行才 SFT,有可验证奖励才谈强化;太贵太慢 → 蒸馏。能说清自己落在哪一支且为什么不落在别支的,是真做过选型。

判别信号:答「为了让模型更懂我们的业务知识」的,是把知识注入当微调理由——这一支应该走 RAG,因为知识会更新而权重会过期。这一问答砸,后面基本可以只走第三段。

分叉:动机是「压成本」→ 直接跳到蒸馏线(教师模型、数据合规、小模型选型、省了多少);动机是「隐性判准」→ 走完整七步。

拷问 2不微调的基线是多少?和 few-shot 比过吗?

期望要点必须有基线数字,而且基线必须是认真调过的提示词 + few-shot,不是随手写的一句话。合格的回答会说清:基线用的哪个模型、什么档位、几个示例、评测集多少条、得分多少。

判别信号:这是整条链的主分水岭。没和 few-shot 基线比过的微调项目,无法证明微调本身有价值——很多「微调提升 20%」的真相是「原来的提示词写得太差」。答不出基线的,分数压到及格线以下。

分叉:报了提升幅度 → 立刻追基线多少、样本多少、置信区间多宽(n=100、基线 80% 时 95% 置信区间约 ±7.8 个百分点;采样参数退场后还要同配置重跑几次报方差)。

第二段 · 要过程(第 3–5 步)

拷问 3训练数据从哪来?多少条?怎么保证质量?

期望要点:能讲出具体的获取与清洗动作:来源(线上日志、人工标注、大模型合成、开源集)、去重、去噪、长度分布、以及标注一致性怎么保证(多人标注的一致率、分歧怎么裁决)。数量上要能说出为什么是这个量级,以及是先小规模验证再扩量,还是一次到位。

加分:说得出「数据质量比数量重要」的具体证据——比如砍掉一批低质样本后指标反而上升。

判别信号:能说「我们先用几百条跑通链路,确认有效后再扩」的,流程是对的;只说「用了 XX 万条」的,往下追清洗过程通常就空。

分叉:提到用大模型造数据 → 追合规(教师模型的服务条款是否允许蒸馏输出用于训练竞品)、同质化(合成数据分布过窄导致过拟合)、教师错误被继承

拷问 4LoRA 的秩和缩放系数怎么定的?加在哪些层?

期望要点:2026 年的共识要能说出来:加在所有线性层(不只是注意力的查询和值投影);学习率大致是全参微调的十倍量级有效批量不要太大。秩和缩放系数要说清是怎么试出来的(从小开始、看是否欠拟合再加),而不是报一个数字说「常用值」。

判别信号只说「加在 q_proj 和 v_proj」的是化石答案——那是 2023 年的做法,说明知识没更新。能说「一开始只加注意力层效果不行,改成全线性层就上来了」的,是自己跑过。

分叉:提到量化版 LoRA → 追它省在哪(基座权重量化存储,训练时反量化计算)、代价是什么(吞吐下降、极低比特下有精度损失)。提到直接偏好优化 → 追它为什么能绕开奖励模型、和策略优化比取舍在哪

拷问 5显存怎么估的?跑在什么卡上、跑了多久?

期望要点:能给估算逻辑而不是背结论:参数、梯度、优化器状态、激活各占多少,全参和低秩微调的差别在哪一项上。以及真实的工程细节:卡型、批量、序列长度、梯度累积、跑了多少小时。

判别信号:这一问是低成本的真实性验证——真跑过的人对「跑了多久、爆没爆显存、怎么解决的」有肌肉记忆,编的人只能给理论值。

拷问 6怎么评测的?除了任务指标,有没有测「别的能力有没有变差」?

期望要点:两件事都要有。① 任务指标:评测集从哪来、和基线怎么比、过没过统计关。② 回归测试:微调后通用能力有没有退化。要能说出灾难性遗忘的交易判据——目标任务提升有限、而其他能力明显下降时,这笔交易就不划算;实践里的粗判是「任务好一成、其他差两成半」就该重新考虑。

加分:说得出评测集是唯一 100% 保值的资产——基座换代后微调权重归零、提示词和索引部分保值,只有评测集完全保值。所以评测集应该第一天就建。

判别信号:只测目标任务的,上线后大概率被通用能力退化反噬;能主动说「我们留了一批通用能力回归题」的,吃过亏或者被教过。

第三段 · 压「今天还会不会这么做」(第 6–7 步)

拷问 7怎么上线的?灰度、回滚、以及基座升级怎么办?

期望要点:上线部分要能说清:灰度比例与观察指标、回滚路径(能不能秒切回基座 + 提示词方案)、推理侧怎么部署(合并权重还是挂适配器,两者在多租户下的差别)。基座升级是这一问的重点——基座换代后原权重不可用,要重训;所以要看当初有没有把数据流水线和评测集沉淀成可复用资产,还是一次性手工搞完就散了。

判别信号:能说「我们把训练数据的清洗脚本和评测集固化下来了,换基座重跑一遍是两天的事」的,是有资产意识的;答「换了基座就得从头再来一遍」的,说明当时是一次性项目。

拷问 8放到今天,你还会微调吗?

期望要点:这是灵魂问的正面形态。合格的回答要正视微调的三面挤压:知识注入被检索接走、格式约束被结构化输出接走、推理深度被推理档位接走。然后给出今天仍然成立的护城河:把大模型能力蒸馏进小模型压成本、有可验证奖励信号的强化训练、写不出来的隐性判准、以及数据主权(不能出网)。

判别信号:全盘否定「现在不需要微调了」的,走了另一个极端;能说「知识那部分我今天会改成检索,但风格判准那部分我还是会微调」的,判断力在线。

拷问 9这个项目最大的遗憾是什么?

期望要点:诚实度题。微调项目常见的真实遗憾:评测集建晚了、没和 few-shot 基线比过所以说不清价值、数据清洗全靠手工没沉淀成流水线、基座升级后成果归零。

这份模板怎么用

候选人简历上写了「基于 LoRA 微调」「领域大模型」「SFT / DPO」「蒸馏了一个小模型」,就走这条链。

微调类项目的特点是技术细节容易背、真实过程很难编:超参可以查到,但「为什么最后是这个」「数据是怎么洗的」「和 few-shot 基线比过没有」只能来自真实经历。所以这条链的重心不在原理,在过程

它还有一个 P1/P2 没有的必答题——灵魂反问「为什么不用 RAG」。2026 年微调被三面挤压,答不出这一问,等于承认当时没做过选型。

七步拷打路径总览

原文示意
① 动机 ─→ ② 基线 ─→ ③ 数据 ─→ ④ 超参 ─→ ⑤ 评测 ─→ ⑥ 上线 ─→ ⑦ 压力
   为什么   不微调    从哪来    怎么定    和谁比    怎么发   今天还会
   要练     能到多少  怎么洗    试过啥    过关没    怎么退   这么做吗
   └── 第一段 ──┘   └────── 第二段 ──────┘        └─ 第三段 ─┘

三段推进的强度递增:第一段答砸可以提前结束(说明是跟风微调),第二段决定基础分,第三段决定他今天的判断力还在不在线。

灵魂反问:为什么不用 RAG?

这一问可以插在任何位置,尤其适合在候选人讲得最流畅的时候打断

  • 第一层:「你这个需求,用检索把资料塞进去不行吗?」
  • 第二层(答「知识太多塞不下」):「那是检索做得不好,不是必须微调的理由——你们试过分块和重排吗?」
  • 第三层(答「要模型学会我们的风格」):「风格能不能用几个例子演示?如果能,为什么不用 few-shot?」
  • 第四层(答「few-shot 占上下文太贵」):「那这是成本问题不是能力问题——你算过微调的训练加维护成本能不能摊平吗?基座半年一换呢?」
  • 第五层(压力):「如果我现在告诉你预算只够做一件事,你选微调还是选把检索和评测做扎实?为什么?」

合格的落点:能在某一层坦然承认「这一层确实检索能解决,我们当时微调的真正理由只有隐性判准这一条」。能把自己的动机收窄到一条并守住的人,比一路辩护的人可信得多。

分叉路径速查

候选人说 立刻追什么
「用 LoRA 微调了 7B」 加在哪些层?学习率相对全参怎么设?有效批量多大?
「只加了 q_proj / v_proj」 这是化石配置——问他试没试过全线性层,结果差多少
「效果提升了 X%」 基线是什么?调过的提示词还是随手写的?样本量和置信区间?
「用了 DPO」 为什么能绕开奖励模型?和策略优化比取舍在哪?偏好数据怎么造的?
「用大模型造了训练数据」 服务条款允许吗?同质化怎么防?教师的错误怎么筛?
「蒸馏了一个小模型」 省了多少?延迟降了多少?教师和学生的差距在哪类样本上最大?
「微调后效果很好」 通用能力测了吗?回归集有多少条?
「基座升级了」 重训成本多少?数据流水线和评测集复用了吗?

排障分支:固定住一个变量,把问题一分为二

微调项目的排障同样统一到这一句:

原文示意
固定「文档」       → 切开 检索侧 / 生成侧      (若方案里含检索)
固定「输入」       → 切开 流量侧 / 系统侧      (金丝雀集,线上突然变差)
固定「模型段」     → 切开 模型侧 / 链路侧      (延迟变高)
固定「token 类别」 → 切开 输入侧 / 输出侧      (成本变高)
固定「变更集」     → 切开 变更侧 / 环境侧      (上线后出事故)

微调专属再加一刀:固定「模型版本」——同一批输入分别过基座 + 提示词、和微调后模型,切开「是微调带来的退化」还是「是数据/链路本身的问题」。这一刀不切,微调项目的锅经常背错。

危险信号清单

出现下列任意两条,基本可以判定项目虚高:

  • 动机是「让模型学会我们的业务知识」(这一支应该走检索)
  • 没和调过的 few-shot 基线比过
  • 报了提升幅度但说不出基线、样本量、置信区间
  • 超参全是「常用值」,说不出试过什么
  • 只加注意力的查询和值投影,且不知道这已经过时
  • 说不出跑在什么卡上、跑了多久、有没有爆显存
  • 只测目标任务,没有通用能力回归
  • 说不出基座升级后怎么办
  • 面对「为什么不用 RAG」全程辩护,一层都不肯让

判分档位

档位 画像
60 分 说得清 SFT/DPO/LoRA 的原理,但没有基线、没有回归测试、超参说不出来由。跑过训练脚本。
75 分 有 few-shot 基线、有评测集、有通用能力回归,超参能说出试错过程,显存和工时是真实的。独立完成过一次微调落地。
90 分 上面全有,且:动机能收窄到三面挤压之后仍成立的那一条;报数字时主动给样本量和统计口径;把数据流水线与评测集当作资产沉淀;被问「今天还会不会这么做」时能分开说哪部分改走检索、哪部分仍然微调。做过,且知道微调今天的边界在哪。

关联题目

Q4-01(后训练主线)、Q4-02(DPO 与 RLHF 取舍)、Q4-04/Q4-05(LoRA 原理与参数)、Q4-06(显存估算)、Q4-07(三问决策树)Q4-08(基座迭代与护城河)、Q4-09(数据来源与质量)、Q4-10(蒸馏与合规)、Q4-11(灾难性遗忘)、Q4-12(七步拷打路径的原型)Q5-01/Q5-08(评测集与回归测试)、Q6-01(自建与 API 的账)

关联题目