这篇学完你能回答什么
- 什么问题该微调、什么该 RAG、什么写好 prompt 就够了?能不能给出一棵能当场画出来的决策树?
- 基座半年一大版,去年微调的模型还有价值吗?微调的护城河到底在哪几条?
- 面试官反问"你那个微调,为什么不用 RAG"的时候,怎么答才不像事后找补?
从一个真实故障讲起
2025 年底,一个做医疗文书结构化的团队在 Gemini 2.5 Pro 上做了一轮 SFT。做得很扎实:8000 条人工校对的病历-结构化字段对,评测集 300 条,字段级 F1 从 0.79 提到 0.91。上线跑了半年,稳定,团队把它写进了年度技术总结。
2026 年 6 月 17 日,Gemini 2.5 Pro 下线。
这在意料之中——基座半年一大版是常态,他们本来准备迁到 3.x。问题是迁不了:截至 2026-08,Gemini 3.x 系还没有开放 SFT。 他们手上那份微调权重,绑在一个已经不存在的基座上;新基座能力更强,但没有微调入口。
于是被迫回退到纯 prompt 方案。团队做好了掉点的准备,重新写了 prompt、加了 12 个 few-shot 例子、把 effort 提了一档,跑评测——
F1 是 0.89。
比微调版低 2 个点,比他们当初的微调前基线(0.79)高了 10 个点。
双重打击:第一,半年的微调资产随基座一起蒸发了;第二,回过头看,新基座加一份好 prompt,已经吃掉了他们当初微调收益的八成。那 2 个点,要不要用一整条微调流水线去换,是个能吵一下午的问题。
这个故事不是在说"别微调"。它在说两件更精确的事:
- 微调权重是唯一带不走的资产。 prompt 换基座能带走(改改就行),评测集能带走,RAG 索引能带走,只有微调权重是绑死在某个基座版本上的。这条决定了它在你的技术投入组合里应该占多大比例。
- 基座每升一版,都在从微调手里收回一块地。 所以"什么时候值得微调"这个问题,2026 年的答案和 2023 年不一样,而且还在变。
2025 年底做了一轮 SFT
8000 条人工校对的病历-字段对
字段级 F1 提到 0.91
评测集 300 条,上线跑了半年
基座 2026-06-17 下线断点
Gemini 2.5 Pro;3.x 尚未开放 SFT迁不了,回退纯 prompt
12 个 few-shot + effort 提一档
回退版 F1 = 0.89
比微调版只低 2 个点
核心概念:先打比方,再给定义
假设你新招了一个能力很强的顾问。他遇到问题时,你有四种干预方式:
- 给他资料(RAG):他不知道你们公司的规章、上周的会议纪要、客户的历史订单。这些不是"能力"问题,是"信息不在手边"问题。给资料,别送去培训。
- 把话说清楚(prompt / effort 档位):他能力够,只是不知道你想要什么、想要多细。先把话说清楚,再考虑别的——这是成本最低、见效最快、可以随时回滚的一档。
- 送去培训(微调):有些东西你说不清楚。"我们所的行文风格"——你写不出规则,只能拿出三百份范文说"照这个感觉"。判据非常锋利:你写不出这条规则,只能给例子,才是微调的场景。
- 换个更便宜的人来做这件事(蒸馏):这个顾问做得很好,但一天调他八十万次太贵了。那就让他带一个便宜的徒弟,把这一件事教会。
这四种干预对应四个动词:给资料、说清楚、送培训、换便宜的人。任何一个"要不要微调"的争论,本质都是在这四个里选。
规章、上周纪要、客户历史订单,查一次就有
这些不是「能力」问题,是「信息不在手边」问题
解决「不知道」:知识、时效、要溯源
把外部内容检索进上下文;改一条不用重训,答案能溯源
拿三百份范文说「照这个感觉」
换一家公司重来一遍,培训记录一点都带不走
解决「说不清楚」的那一类
把只能示范的判准烧进权重;判据是你写不出这条规则,只能给例子
原理拆解
| 投入 | 换基座时能带走 | 读法 |
|---|---|---|
| 评测集 | 100% | 越攒越值钱,唯一跨基座保值的东西 |
| prompt | 改改就能用 | 重调一遍,不用重做 |
| RAG 索引 | 换 embedding 才要重建 | 内容不动就不用动 |
| 微调权重 | 0% | 基座一换全归零 |
微调被吃掉了三块半:知识注入 → RAG;格式与指令遵循 → 基座能力 + 结构化输出(OpenAI 官方拿这条当收缩微调平台的理由);推理深度 → effort 档位;半块 few-shot 示范 → 长上下文 + prompt 缓存。
剩下四条护城河:成本与延迟的规模化压缩(蒸到小模型,2026 最站得住的一条)、可验证奖励任务上的真实能力增量、写不进 prompt 的隐性风格与判准、私有部署与数据主权。
三问决策树(本章核心骨架,后续场景题复用)
┌─────────────────────────────────────────────────┐
│ 前置闸门:没有评测集,四条路一条都不要开始 │
│ (至少 50–100 条,含边界样例;先跑 few-shot 基线)│
└───────────────────────┬─────────────────────────┘
▼
模型的问题属于哪一类?
│
┌────────────────────────────┼────────────────────────────┐
▼ ▼ ▼
「不知道」 「不会做」 「做得到但太贵太慢」
知识 / 时效 / 要溯源 能力 / 格式 / 风格 延迟 / 单价 / QPS
│ │ │
▼ ▼ ▼
RAG ① 先提 effort 档位 蒸馏到小模型
+ 改 prompt (用大模型造数据
│ 训小模型)
├─ 仍不行,且规则写不出、
│ 只能给例子 → SFT / LoRA
│
└─ 仍不行,且能写自动判分器
→ RLVR / RFT这棵树的用法是自上而下、逐级排除,不能跳级。 面试里最常见的失分,是候选人直接从"我们做了微调"开始讲,跳过了前面所有更便宜的选项,于是整段回答都建立在一个没被验证的前提上。
微调被吃掉的三块半
2023 年微调的地盘比现在大得多。这几年被切走的部分,每一块都有明确的接手方:
| 被吃掉的 | 接手方 | 现在的口径 |
|---|---|---|
| 知识注入 | RAG | 2023 年就成立,现在没人再争。微调灌知识既贵又不可溯源,改一条要重训一次 |
| 格式与指令遵循 | 基座能力 + 结构化输出/约束解码 | OpenAI 官方拿这条当收缩微调平台的理由:新基座在指令与格式遵循上大幅提升,prompt 方案更便宜更快 |
| 推理深度 | effort 档位 | 承接本项目已冻结口径:答得浅是提档位,不是加提示词,更不是微调 |
| (半块)few-shot 示范 | 长上下文 + prompt 缓存 | many-shot ICL 让"塞进几百个例子"从奢侈变成日常,且缓存命中后几乎不加钱 |
"半块"是因为它没被完全吃掉:当例子数量大到 prompt 缓存也扛不住、或者每次请求的固定成本无法接受时,把它烧进权重仍然划算。这正好是下一节第一条护城河的入口。
剩下的四条护城河
护城河 1:成本与延迟的规模化压缩。 把大模型的能力蒸到小模型上。高 QPS 场景下这能省掉一个数量级的成本,同时把首 token 延迟压下来。这是 2026 年最主流、也最站得住的微调理由——它不依赖"微调能让模型更强"这个已经站不住的假设,它依赖的是"同样的效果,我用更小的模型达成"。
护城河 2:可验证奖励任务上的真实能力增量。 任务有自动判分器、专家答案能收敛(这一点很关键:如果合格的专家之间都吵不出统一答案,说明任务定义本身有问题,不该拿去训)。这一档拿到的是 prompt 做不到的能力提升,而不只是风格重排。截至 2026-08,OpenAI 的强化微调 RFT 只支持 o4-mini,开源侧则是 GRPO 系的天下。
护城河 3:不可言说的隐性风格与判准。 写不进 prompt、只能从几百上千条样本里学的行业腔调:法律文书的口吻、医疗记录的规范、特定品牌的语气、某个行业里"这句话必须这么说"的默契。判据:你写不出这条规则,只能给例子。 反过来,如果你能把规则写成 200 字的 system prompt,那就别训。
护城河 4:私有部署与数据主权。 数据不能出域、只能本地跑开源权重的场景。这里没有 effort 档位可以提、没有更强的闭源基座可以换,微调是唯一的提升手段。这条对国内的金融、政务、医疗团队尤其成立,也是国内微调需求明显强于海外的结构性原因。
反向判断:三个 2026 年的错误理由
面试里听到这三条,基本可以判定候选人的认知停在两三年前:
- "让模型学会我们公司的知识" → 该 RAG。微调灌知识不可溯源、更新要重训、还会挤掉通用能力。
- "让它稳定输出 JSON" → 该用结构化输出 / 约束解码(并配三层校验:语法、值域、业务)。
- "让它更聪明 / 推理更强" → 该提 effort 档位。偏好对齐不长能力,SFT 也不长能力。
一条容易被忽略的判据:资产寿命
把四种投入按"换基座时能带走多少"排一次序,会得到一个很实用的决策线:
评测集 ████████████████████ 100% 能带走,而且越攒越值钱
prompt ████████████████░░░░ 改改就能用
RAG 索引 ████████████████░░░░ 换 embedding 才要重建
微调权重 ░░░░░░░░░░░░░░░░░░░░ 0%,基座一换全归零
于是"要不要微调"可以换个问法:你愿意把多大比例的投入,压在一个基座换版就归零的资产上? 开头那个团队的教训不是"不该微调",是他们把评测集之外的几乎全部投入都压在了那一块上。
工程实践(截至 2026-08)
厂商侧现状:闭源在收,开源在扩
| 厂商 | 微调可用性 | 关键时点 |
|---|---|---|
| OpenAI | 正在收缩。SFT/DPO 支持 gpt-4.1 系,RFT 仅 o4-mini | 2026-05-07 起新组织不能创建微调任务;2026-07-02 起 60 天无推理的组织被关闭;2027-01-06 起存量客户也不能再创建新任务;已训模型可推理至基座下线 |
| SFT 在,但断档 | Gemini 3.x 尚未开放 SFT;2.5 Pro 已于 2026-06-17 下线 | |
| Anthropic | 仅 Bedrock 上 Claude 3 Haiku | —— |
| 开源权重 + 国内云平台(百炼 / 方舟 / PAI 等) | 全链路健在,是国内团队的实际主战场 | —— |
OpenAI 给出的理由值得原样记住,因为它就是本章的论点:新基座在指令与格式遵循上大幅提升,基于 prompt 的方案更便宜更快,需要微调的用例在变少。
四条路的成本量级对照
| 路径 | 见效周期 | 主要成本 | 可回滚性 | 换基座 |
|---|---|---|---|---|
| prompt / effort | 小时 | 接近 0 | 立即 | 改改就行 |
| RAG | 天 ~ 周 | 索引构建 + 持续维护 | 切开关 | 基本无损 |
| LoRA SFT | 天(训练)+ 周(评测集) | 数据标注 > 算力 | 换回基座 | 归零 |
| RLVR / RFT | 周 ~ 月 | 判分器 + 采样算力 + 专职人力 | 换回基座 | 归零 |
注意 LoRA SFT 那一行的成本大头是数据标注而不是算力。7B 的 LoRA 微调大概 19 G 显存、几小时,算力钱不值一提;真正贵的是"谁来标这 1500 条、标多久、判准谁定"。面试里能主动把成本重心从 GPU 挪到标注上的候选人不多,这是个好信号。
避坑清单
- 没有评测集就不要开始。 这是四条路共同的前置闸门,也是本篇唯一的硬规则。50–100 条起步,必须含边界样例。
- 先跑 few-shot 基线,并把分数记下来。 没有基线的微调"提升",在面试里等于没有提升;在项目里等于没法判断该不该继续投。
- 别用微调解决知识问题。 每次知识更新都要重训,且答案无法溯源。
- 微调前先把 effort 档位提满试一次。 成本近乎为零,很多"模型不够强"的问题在这一步就没了。
- 把评测集当成核心资产维护。 它是唯一跨基座保值的东西,也是你下次换模型时唯一能立刻回答"新的比旧的好不好"的工具。
- 微调上线后,给基座版本设一个复查提醒。 基座升级时主动重跑一次"新基座 + prompt"对照,看你的微调收益还剩多少。开头那个团队如果季度性做过这件事,不会到下线那天才发现只剩 2 个点。
| 厂商 | 微调可用性 | 关键时点 |
|---|---|---|
| OpenAI | 正在收缩。SFT/DPO 支持 gpt-4.1 系,RFT 仅 o4-mini | 2026-05-07 起新组织不能创建微调任务;2026-07-02 起 60 天无推理的组织被关闭;2027-01-06 起存量客户也不能再创建新任务;已训模型可推理至基座下线 |
| SFT 在,但断档 | Gemini 3.x 尚未开放 SFT;2.5 Pro 已于 2026-06-17 下线 | |
| Anthropic | 仅 Amazon Bedrock 上的 Claude 3 Haiku | —— |
| 开源权重 + 国内云平台(百炼 / 方舟 / PAI 等)主战场在这 | 全链路健在 | 国内团队的实际主战场 |
- prompt / effort
- 小时级见效,成本接近 0,立即可回滚,换基座改改就行 —— 所以它排第一个试
- RAG
- 天 ~ 周;成本在索引构建与持续维护,切开关就能回滚,换基座基本无损
- LoRA SFT
- 天(训练)+ 周(评测集);成本大头是数据标注,可回滚到基座,换基座归零
- RLVR / RFT
- 周 ~ 月;判分器 + 采样算力 + 专职人力,可回滚到基座,换基座同样归零
- 唯一的硬规则
- 没有评测集,四条路一条都不要开始;50–100 条起步,必须含边界样例
- 给基座版本设复查提醒
- 基座升级时主动重跑一次「新基座 + prompt」对照,看微调收益还剩多少
面试视角
- 先澄清「不知道」「不会做」还是「太贵太慢」
- 给基线prompt + effort 能到什么程度,有没有评测集
- 加挂并说代价数据标注、基座绑定,还是判分器建设
- 谈评测怎么证明这一档确实比上一档好
- 谈演进基座升级时,这套东西怎么办
- 「微调让模型学到我们的领域知识」—— 知识那一类该走 RAG
- 「我们做了微调,效果提升明显」—— 没有 few-shot 基线等于没有提升
- 「微调很贵,主要是 GPU 成本」—— 成本重心整个搞反了
- 「基座升级了就重新微调一遍」—— 没算过资产寿命这笔账
- 上来就讲「我们的方案是微调」—— 整个排除过程被跳过了
- 「知识走 RAG,微调只解决写不出规则、只能给例子的那部分」
- 「基线 0.79、微调后 0.91;这 12 个点里新基座白送多少,每季度重测」
- 「7B 的 LoRA 几小时几百块,真正贵的是标注和判准共识」
- 「微调权重是唯一带不走的资产,所以投入重心压在评测集上」
- 「2027-01-06 起 OpenAI 连存量客户都不能建新微调任务了」
面试官怎么问
Q4-07(三者怎么选)几乎是各轮必问,属于选型判断题;Q4-08(基座升级后微调还有没有价值)是三面或技术负责人爱问的,考的是技术投资判断而不是技术知识;Q4-12 是简历深挖,会直接冲着你写在简历上的那次微调来。
三道题的共同点是:它们都不考知识,考判断。 所以答案里必须有"我排除了什么、为什么排除"。
答题结构建议
沿用本项目的五步骨架,在这一章的具体化版本是:
- 先澄清:问题是"不知道"、"不会做"、还是"太贵太慢"?——不澄清就答的,直接扣分。
- 给基线:先说 prompt + effort 能到什么程度,以及有没有评测集。
- 加挂并说代价:需要哪一档,代价是数据标注、基座绑定、还是判分器建设。
- 谈评测:怎么证明这一档确实比上一档好——必须有 few-shot 基线对照。
- 谈演进:基座升级时这套东西怎么办。
第 5 步是这一章特有的,也是最能打动技术负责人的一步。
分水岭信号
| 只读过 | 真做过 |
|---|---|
| "微调让模型学到我们的领域知识" | "知识走 RAG,微调只解决写不出规则、只能给例子的那部分" |
| "我们做了微调,效果提升明显" | "few-shot 基线是 0.79,微调后 0.91;这 12 个点里有多少是新基座能白送的,我们每个季度重测一次" |
| "微调很贵,主要是 GPU 成本" | "7B 的 LoRA 几小时几百块,真正贵的是标注和判准共识" |
| "基座升级了就重新微调一遍" | "微调权重是唯一带不走的资产,所以我们把投入重心压在评测集上" |
| "微调能提升模型能力" | "SFT 和偏好对齐都不长能力,能力增量只能靠可验证奖励那一档,前提是写得出判分器" |
| 直接从"我们的方案是微调"开始讲 | 先讲排除过程:为什么不是 RAG、为什么 prompt 不够、为什么不直接换更强的基座 |
| (不提) | "OpenAI 2027 年 1 月起连存量客户都不能建新微调任务了,所以选型时要把厂商路线风险算进去" |
最后一行在 2026 年下半年是很强的加分项:它说明候选人在跟踪厂商路线,而不只是跟踪技术论文。
小结与延伸
- 四种干预对应四个动词:给资料(RAG)、说清楚(prompt/effort)、送培训(微调)、换便宜的人(蒸馏)。三问决策树自上而下逐级排除,不能跳级;前置闸门是评测集。
- 微调被吃掉三块半:知识→RAG、格式→基座+结构化输出、推理深度→effort 档位、(半)few-shot→长上下文+缓存。
- 剩下四条护城河:成本压缩、可验证奖励、不可言说的隐性风格、私有部署。三个 2026 年的错误理由:学知识、出 JSON、变聪明。
- 微调权重是唯一换基座带不走的资产;评测集是唯一越攒越值钱的资产。这条决定了投入该怎么分配。
- 截至 2026-08 的路线分化:闭源在收(OpenAI 2027-01-06 全面停建、Gemini 3.x 断档),开源与国内云平台在扩。
延伸:决定了要微调之后,八成的成败在数据。下一篇 T4-4 讲数据怎么造、蒸馏的合规边界在哪,以及那个几乎必然出现的副作用——灾难性遗忘。
继续深入
本篇归属第 4 章「微调与对齐」,去做这一章的题。