选型判断:prompt、RAG、微调,以及 2026 年微调还剩几条护城河

T4-3模块 4 · 微调与对齐面试权重 更新于 2026-08-19
关联题目Q4-07Q4-08Q4-12

这篇学完你能回答什么

  1. 什么问题该微调、什么该 RAG、什么写好 prompt 就够了?能不能给出一棵能当场画出来的决策树?
  2. 基座半年一大版,去年微调的模型还有价值吗?微调的护城河到底在哪几条?
  3. 面试官反问"你那个微调,为什么不用 RAG"的时候,怎么答才不像事后找补?

从一个真实故障讲起

2025 年底,一个做医疗文书结构化的团队在 Gemini 2.5 Pro 上做了一轮 SFT。做得很扎实:8000 条人工校对的病历-结构化字段对,评测集 300 条,字段级 F1 从 0.79 提到 0.91。上线跑了半年,稳定,团队把它写进了年度技术总结。

2026 年 6 月 17 日,Gemini 2.5 Pro 下线

这在意料之中——基座半年一大版是常态,他们本来准备迁到 3.x。问题是迁不了:截至 2026-08,Gemini 3.x 系还没有开放 SFT。 他们手上那份微调权重,绑在一个已经不存在的基座上;新基座能力更强,但没有微调入口。

于是被迫回退到纯 prompt 方案。团队做好了掉点的准备,重新写了 prompt、加了 12 个 few-shot 例子、把 effort 提了一档,跑评测——

F1 是 0.89。

比微调版低 2 个点,比他们当初的微调前基线(0.79)高了 10 个点。

双重打击:第一,半年的微调资产随基座一起蒸发了;第二,回过头看,新基座加一份好 prompt,已经吃掉了他们当初微调收益的八成。那 2 个点,要不要用一整条微调流水线去换,是个能吵一下午的问题。

这个故事不是在说"别微调"。它在说两件更精确的事:

  1. 微调权重是唯一带不走的资产。 prompt 换基座能带走(改改就行),评测集能带走,RAG 索引能带走,只有微调权重是绑死在某个基座版本上的。这条决定了它在你的技术投入组合里应该占多大比例。
  2. 基座每升一版,都在从微调手里收回一块地。 所以"什么时候值得微调"这个问题,2026 年的答案和 2023 年不一样,而且还在变。
微调权重是唯一带不走的那块资产
8000 条标注、半年稳定运行,栽在一个和团队无关的下线公告上

  1. 2025 年底做了一轮 SFT

    8000 条人工校对的病历-字段对

  2. 字段级 F1 提到 0.91

    评测集 300 条,上线跑了半年

  3. 基座 2026-06-17 下线断点

    Gemini 2.5 Pro;3.x 尚未开放 SFT

  4. 迁不了,回退纯 prompt

    12 个 few-shot + effort 提一档

  5. 回退版 F1 = 0.89

    比微调版只低 2 个点

字段级 F1微调前 0.79微调后 0.91
纯 prompt 回退版已经做好掉点准备0.89,比基线高 10 个点
当初那 12 个点的收益算在微调头上八成被新基座吃掉了
半年的微调权重绑在 2.5 Pro 上随基座一起蒸发
四种投入里只有微调权重跟着基座一起归零:prompt 换基座改改就能用,评测集越攒越值钱,RAG 索引换 embedding 才要重建。所以真问题是比例 —— 他们把评测集之外的投入几乎全压在了那一块上。

核心概念:先打比方,再给定义

假设你新招了一个能力很强的顾问。他遇到问题时,你有四种干预方式:

  • 给他资料(RAG):他不知道你们公司的规章、上周的会议纪要、客户的历史订单。这些不是"能力"问题,是"信息不在手边"问题。给资料,别送去培训。
  • 把话说清楚(prompt / effort 档位):他能力够,只是不知道你想要什么、想要多细。先把话说清楚,再考虑别的——这是成本最低、见效最快、可以随时回滚的一档。
  • 送去培训(微调):有些东西你说不清楚。"我们所的行文风格"——你写不出规则,只能拿出三百份范文说"照这个感觉"。判据非常锋利:你写不出这条规则,只能给例子,才是微调的场景。
  • 换个更便宜的人来做这件事(蒸馏):这个顾问做得很好,但一天调他八十万次太贵了。那就让他带一个便宜的徒弟,把这一件事教会。

这四种干预对应四个动词:给资料、说清楚、送培训、换便宜的人。任何一个"要不要微调"的争论,本质都是在这四个里选。

不是能力问题的,别送去培训
四种干预对应四个动词,「要不要微调」的争论本质是在这四个里选

给他资料

规章、上周纪要、客户历史订单,查一次就有

这些不是「能力」问题,是「信息不在手边」问题

对应
RAG · 给资料

解决「不知道」:知识、时效、要溯源

把外部内容检索进上下文;改一条不用重训,答案能溯源

索引embedding溯源
送他去培训

拿三百份范文说「照这个感觉」

换一家公司重来一遍,培训记录一点都带不走

对应
微调 · 送培训

解决「说不清楚」的那一类

把只能示范的判准烧进权重;判据是你写不出这条规则,只能给例子

评测集few-shot 基线基座绑定
另外两个动词才是最常被跳过的:说清楚(prompt 与 effort 档位)成本最低、见效最快、随时可回滚,该第一个试;换便宜的人(蒸馏)解决的是太贵太慢,不是不会做。

原理拆解

自上而下逐级排除,一级都不能跳
先分清「不知道」「不会做」「太贵太慢」,再谈要不要微调

前置闸门
先有评测集50–100 条起,含边界样例
先跑 few-shot 基线没基线就没有「提升」
问题属于哪一类
「不知道」知识 / 时效 / 要溯源
「不会做」能力 / 格式 / 风格
「太贵太慢」延迟 / 单价 / QPS
先走最便宜的一档
RAG给资料,别送去培训
提 effort、改 prompt成本近乎为零,先试满
蒸馏到小模型用大模型造数据训小模型
仍不行才升档
SFT / LoRA规则写不出,只能给例子
RLVR / RFT能写出自动判分器
资产寿命:换一次基座,这笔投入还剩多少
投入换基座时能带走读法
评测集100%越攒越值钱,唯一跨基座保值的东西
prompt改改就能用重调一遍,不用重做
RAG 索引换 embedding 才要重建内容不动就不用动
微调权重0%基座一换全归零

微调被吃掉了三块半:知识注入 → RAG;格式与指令遵循 → 基座能力 + 结构化输出(OpenAI 官方拿这条当收缩微调平台的理由);推理深度 → effort 档位;半块 few-shot 示范 → 长上下文 + prompt 缓存。

剩下四条护城河:成本与延迟的规模化压缩(蒸到小模型,2026 最站得住的一条)、可验证奖励任务上的真实能力增量、写不进 prompt 的隐性风格与判准、私有部署与数据主权。

面试里最常见的失分,是直接从「我们做了微调」开始讲 —— 跳过了前面所有更便宜的选项,于是整段回答建立在一个没被验证的前提上。答案里必须有「我排除了什么、为什么排除」。

三问决策树(本章核心骨架,后续场景题复用)

原文示意
        ┌─────────────────────────────────────────────────┐
        │  前置闸门:没有评测集,四条路一条都不要开始     │
        │  (至少 50–100 条,含边界样例;先跑 few-shot 基线)│
        └───────────────────────┬─────────────────────────┘
                                ▼
                  模型的问题属于哪一类?
                                │
   ┌────────────────────────────┼────────────────────────────┐
   ▼                            ▼                            ▼
「不知道」                  「不会做」                  「做得到但太贵太慢」
知识 / 时效 / 要溯源        能力 / 格式 / 风格          延迟 / 单价 / QPS
   │                            │                            │
   ▼                            ▼                            ▼
  RAG                    ① 先提 effort 档位             蒸馏到小模型
                            + 改 prompt                (用大模型造数据
                              │                          训小模型)
                              ├─ 仍不行,且规则写不出、
                              │  只能给例子  →  SFT / LoRA
                              │
                              └─ 仍不行,且能写自动判分器
                                              →  RLVR / RFT

这棵树的用法是自上而下、逐级排除,不能跳级。 面试里最常见的失分,是候选人直接从"我们做了微调"开始讲,跳过了前面所有更便宜的选项,于是整段回答都建立在一个没被验证的前提上。

微调被吃掉的三块半

2023 年微调的地盘比现在大得多。这几年被切走的部分,每一块都有明确的接手方:

被吃掉的 接手方 现在的口径
知识注入 RAG 2023 年就成立,现在没人再争。微调灌知识既贵又不可溯源,改一条要重训一次
格式与指令遵循 基座能力 + 结构化输出/约束解码 OpenAI 官方拿这条当收缩微调平台的理由:新基座在指令与格式遵循上大幅提升,prompt 方案更便宜更快
推理深度 effort 档位 承接本项目已冻结口径:答得浅是提档位,不是加提示词,更不是微调
(半块)few-shot 示范 长上下文 + prompt 缓存 many-shot ICL 让"塞进几百个例子"从奢侈变成日常,且缓存命中后几乎不加钱

"半块"是因为它没被完全吃掉:当例子数量大到 prompt 缓存也扛不住、或者每次请求的固定成本无法接受时,把它烧进权重仍然划算。这正好是下一节第一条护城河的入口。

剩下的四条护城河

护城河 1:成本与延迟的规模化压缩。 把大模型的能力蒸到小模型上。高 QPS 场景下这能省掉一个数量级的成本,同时把首 token 延迟压下来。这是 2026 年最主流、也最站得住的微调理由——它不依赖"微调能让模型更强"这个已经站不住的假设,它依赖的是"同样的效果,我用更小的模型达成"。

护城河 2:可验证奖励任务上的真实能力增量。 任务有自动判分器、专家答案能收敛(这一点很关键:如果合格的专家之间都吵不出统一答案,说明任务定义本身有问题,不该拿去训)。这一档拿到的是 prompt 做不到的能力提升,而不只是风格重排。截至 2026-08,OpenAI 的强化微调 RFT 只支持 o4-mini,开源侧则是 GRPO 系的天下。

护城河 3:不可言说的隐性风格与判准。 写不进 prompt、只能从几百上千条样本里学的行业腔调:法律文书的口吻、医疗记录的规范、特定品牌的语气、某个行业里"这句话必须这么说"的默契。判据:你写不出这条规则,只能给例子。 反过来,如果你能把规则写成 200 字的 system prompt,那就别训。

护城河 4:私有部署与数据主权。 数据不能出域、只能本地跑开源权重的场景。这里没有 effort 档位可以提、没有更强的闭源基座可以换,微调是唯一的提升手段。这条对国内的金融、政务、医疗团队尤其成立,也是国内微调需求明显强于海外的结构性原因。

反向判断:三个 2026 年的错误理由

面试里听到这三条,基本可以判定候选人的认知停在两三年前:

  1. "让模型学会我们公司的知识" → 该 RAG。微调灌知识不可溯源、更新要重训、还会挤掉通用能力。
  2. "让它稳定输出 JSON" → 该用结构化输出 / 约束解码(并配三层校验:语法、值域、业务)。
  3. "让它更聪明 / 推理更强" → 该提 effort 档位。偏好对齐不长能力,SFT 也不长能力。

一条容易被忽略的判据:资产寿命

把四种投入按"换基座时能带走多少"排一次序,会得到一个很实用的决策线:

评测集      ████████████████████  100% 能带走,而且越攒越值钱
prompt      ████████████████░░░░  改改就能用
RAG 索引    ████████████████░░░░  换 embedding 才要重建
微调权重    ░░░░░░░░░░░░░░░░░░░░  0%,基座一换全归零

于是"要不要微调"可以换个问法:你愿意把多大比例的投入,压在一个基座换版就归零的资产上? 开头那个团队的教训不是"不该微调",是他们把评测集之外的几乎全部投入都压在了那一块上。

工程实践(截至 2026-08)

厂商侧现状:闭源在收,开源在扩

厂商 微调可用性 关键时点
OpenAI 正在收缩。SFT/DPO 支持 gpt-4.1 系,RFT 仅 o4-mini 2026-05-07 起新组织不能创建微调任务;2026-07-02 起 60 天无推理的组织被关闭;2027-01-06 起存量客户也不能再创建新任务;已训模型可推理至基座下线
Google SFT 在,但断档 Gemini 3.x 尚未开放 SFT;2.5 Pro 已于 2026-06-17 下线
Anthropic 仅 Bedrock 上 Claude 3 Haiku ——
开源权重 + 国内云平台(百炼 / 方舟 / PAI 等) 全链路健在,是国内团队的实际主战场 ——

OpenAI 给出的理由值得原样记住,因为它就是本章的论点:新基座在指令与格式遵循上大幅提升,基于 prompt 的方案更便宜更快,需要微调的用例在变少

四条路的成本量级对照

路径 见效周期 主要成本 可回滚性 换基座
prompt / effort 小时 接近 0 立即 改改就行
RAG 天 ~ 周 索引构建 + 持续维护 切开关 基本无损
LoRA SFT 天(训练)+ 周(评测集) 数据标注 > 算力 换回基座 归零
RLVR / RFT 周 ~ 月 判分器 + 采样算力 + 专职人力 换回基座 归零

注意 LoRA SFT 那一行的成本大头是数据标注而不是算力。7B 的 LoRA 微调大概 19 G 显存、几小时,算力钱不值一提;真正贵的是"谁来标这 1500 条、标多久、判准谁定"。面试里能主动把成本重心从 GPU 挪到标注上的候选人不多,这是个好信号。

避坑清单

  1. 没有评测集就不要开始。 这是四条路共同的前置闸门,也是本篇唯一的硬规则。50–100 条起步,必须含边界样例。
  2. 先跑 few-shot 基线,并把分数记下来。 没有基线的微调"提升",在面试里等于没有提升;在项目里等于没法判断该不该继续投。
  3. 别用微调解决知识问题。 每次知识更新都要重训,且答案无法溯源。
  4. 微调前先把 effort 档位提满试一次。 成本近乎为零,很多"模型不够强"的问题在这一步就没了。
  5. 把评测集当成核心资产维护。 它是唯一跨基座保值的东西,也是你下次换模型时唯一能立刻回答"新的比旧的好不好"的工具。
  6. 微调上线后,给基座版本设一个复查提醒。 基座升级时主动重跑一次"新基座 + prompt"对照,看你的微调收益还剩多少。开头那个团队如果季度性做过这件事,不会到下线那天才发现只剩 2 个点。
闭源在收口,开源和国内云在扩
选型要把厂商路线风险算进去:2027-01-06 是 OpenAI 的最后期限

厂商侧现状
厂商微调可用性关键时点
OpenAI正在收缩。SFT/DPO 支持 gpt-4.1 系,RFT 仅 o4-mini2026-05-07 起新组织不能创建微调任务;2026-07-02 起 60 天无推理的组织被关闭;2027-01-06 起存量客户也不能再创建新任务;已训模型可推理至基座下线
GoogleSFT 在,但断档Gemini 3.x 尚未开放 SFT;2.5 Pro 已于 2026-06-17 下线
Anthropic仅 Amazon Bedrock 上的 Claude 3 Haiku——
开源权重 + 国内云平台(百炼 / 方舟 / PAI 等)主战场在这全链路健在国内团队的实际主战场
四条路的成本量级
prompt / effort
小时级见效,成本接近 0,立即可回滚,换基座改改就行 —— 所以它排第一个试
RAG
天 ~ 周;成本在索引构建与持续维护,切开关就能回滚,换基座基本无损
LoRA SFT
天(训练)+ 周(评测集);成本大头是数据标注,可回滚到基座,换基座归零
RLVR / RFT
周 ~ 月;判分器 + 采样算力 + 专职人力,可回滚到基座,换基座同样归零
唯一的硬规则
没有评测集,四条路一条都不要开始;50–100 条起步,必须含边界样例
给基座版本设复查提醒
基座升级时主动重跑一次「新基座 + prompt」对照,看微调收益还剩多少
注意 LoRA SFT 那一行:成本大头是数据标注而不是算力。7B 的 LoRA 几小时几百块,真正贵的是谁来标这 1500 条、标多久、判准谁定。能主动把成本重心从 GPU 挪走的候选人不多。

面试视角

这三道题不考知识,考的是判断
Q4-07 各轮必问,Q4-08 是技术负责人的题,Q4-12 直冲你的简历

  1. 先澄清「不知道」「不会做」还是「太贵太慢」
  2. 给基线prompt + effort 能到什么程度,有没有评测集
  3. 加挂并说代价数据标注、基座绑定,还是判分器建设
  4. 谈评测怎么证明这一档确实比上一档好
  5. 谈演进基座升级时,这套东西怎么办
只读过:这些回答会暴露你
  • 「微调让模型学到我们的领域知识」—— 知识那一类该走 RAG
  • 「我们做了微调,效果提升明显」—— 没有 few-shot 基线等于没有提升
  • 「微调很贵,主要是 GPU 成本」—— 成本重心整个搞反了
  • 「基座升级了就重新微调一遍」—— 没算过资产寿命这笔账
  • 上来就讲「我们的方案是微调」—— 整个排除过程被跳过了
真做过:这些细节骗不了人
  • 「知识走 RAG,微调只解决写不出规则、只能给例子的那部分」
  • 「基线 0.79、微调后 0.91;这 12 个点里新基座白送多少,每季度重测」
  • 「7B 的 LoRA 几小时几百块,真正贵的是标注和判准共识」
  • 「微调权重是唯一带不走的资产,所以投入重心压在评测集上」
  • 「2027-01-06 起 OpenAI 连存量客户都不能建新微调任务了」
第 5 步是这一章特有的,也最能打动技术负责人:基座升级时这套东西怎么办。跟踪厂商路线而不只是跟踪论文,在 2026 年下半年是很强的加分项。

面试官怎么问

Q4-07(三者怎么选)几乎是各轮必问,属于选型判断题;Q4-08(基座升级后微调还有没有价值)是三面或技术负责人爱问的,考的是技术投资判断而不是技术知识;Q4-12 是简历深挖,会直接冲着你写在简历上的那次微调来。

三道题的共同点是:它们都不考知识,考判断。 所以答案里必须有"我排除了什么、为什么排除"。

答题结构建议

沿用本项目的五步骨架,在这一章的具体化版本是:

  1. 先澄清:问题是"不知道"、"不会做"、还是"太贵太慢"?——不澄清就答的,直接扣分。
  2. 给基线:先说 prompt + effort 能到什么程度,以及有没有评测集。
  3. 加挂并说代价:需要哪一档,代价是数据标注、基座绑定、还是判分器建设。
  4. 谈评测:怎么证明这一档确实比上一档好——必须有 few-shot 基线对照。
  5. 谈演进:基座升级时这套东西怎么办。

第 5 步是这一章特有的,也是最能打动技术负责人的一步。

分水岭信号

只读过 真做过
"微调让模型学到我们的领域知识" "知识走 RAG,微调只解决写不出规则、只能给例子的那部分"
"我们做了微调,效果提升明显" "few-shot 基线是 0.79,微调后 0.91;这 12 个点里有多少是新基座能白送的,我们每个季度重测一次"
"微调很贵,主要是 GPU 成本" "7B 的 LoRA 几小时几百块,真正贵的是标注和判准共识"
"基座升级了就重新微调一遍" "微调权重是唯一带不走的资产,所以我们把投入重心压在评测集上"
"微调能提升模型能力" "SFT 和偏好对齐都不长能力,能力增量只能靠可验证奖励那一档,前提是写得出判分器"
直接从"我们的方案是微调"开始讲 先讲排除过程:为什么不是 RAG、为什么 prompt 不够、为什么不直接换更强的基座
(不提) "OpenAI 2027 年 1 月起连存量客户都不能建新微调任务了,所以选型时要把厂商路线风险算进去"

最后一行在 2026 年下半年是很强的加分项:它说明候选人在跟踪厂商路线,而不只是跟踪技术论文。

小结与延伸

  • 四种干预对应四个动词:给资料(RAG)、说清楚(prompt/effort)、送培训(微调)、换便宜的人(蒸馏)。三问决策树自上而下逐级排除,不能跳级;前置闸门是评测集。
  • 微调被吃掉三块半:知识→RAG、格式→基座+结构化输出、推理深度→effort 档位、(半)few-shot→长上下文+缓存
  • 剩下四条护城河:成本压缩、可验证奖励、不可言说的隐性风格、私有部署。三个 2026 年的错误理由:学知识、出 JSON、变聪明。
  • 微调权重是唯一换基座带不走的资产;评测集是唯一越攒越值钱的资产。这条决定了投入该怎么分配。
  • 截至 2026-08 的路线分化:闭源在收(OpenAI 2027-01-06 全面停建、Gemini 3.x 断档),开源与国内云平台在扩。

延伸:决定了要微调之后,八成的成败在数据。下一篇 T4-4 讲数据怎么造、蒸馏的合规边界在哪,以及那个几乎必然出现的副作用——灾难性遗忘。

关联题目Q4-07(三者怎么选)、Q4-08(微调的护城河)、Q4-12(简历深挖)

继续深入

本篇归属第 4 章「微调与对齐」,去做这一章的题