基座模型半年一大版,你去年微调的模型还有价值吗?微调的护城河在哪?

Q4-08技术投资判断高频微调护城河基座迭代资产寿命厂商风险技术投资

谁在问:三面 / 技术负责人 / CTO;考的是技术投资判断而非技术知识

口语化问法

  • 基座模型迭代这么快,你辛辛苦苦微调的模型,下个版本出来是不是就白做了?
  • 现在还有微调的必要吗?我看很多能力新模型直接就有了。
  • 如果让你决定,我们团队要不要投人做微调?

考察意图

这是一道技术投资判断题,不考知识考判断。面试官(通常是技术负责人或三面)在看:

  1. 有没有资产寿命的概念。知不知道哪些投入随基座蒸发、哪些跨版本保值。
  2. 能不能给出正向理由而不只是防守。只会说"微调还是有用的"是弱回答;能说清还剩哪几条护城河、每条的判据是什么才是强回答。
  3. 跟不跟厂商路线。截至 2026-08,闭源侧正在收缩微调入口,这本身就是这道题在 2026 年凭空升值的原因。知道这件事的候选人不多。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

有价值,但价值在缩水。

基座每升一版,通用能力都会提升,去年靠微调获得的一部分优势会被新基座免费送掉。所以微调的收益需要定期重新评估。

不过微调还是有它的场景:私有部署不能用闭源模型的、需要特定风格的、需要把大模型能力压到小模型上降成本的。这些新基座解决不了。

顺序上,应该先看新基座 + 好 prompt 能到什么程度,再决定要不要重新微调。

判断方向对,及格。但"价值在缩水"是定性描述,没有量化方法,也没有厂商路线视角,追问会散。

90

90 分答案(有生产经验的回答)

先给结论:微调没死,但它的地盘被三面挤压,而且闭源侧正在主动退出。所以这道题的答案不是"有没有价值",是"哪几条还有、你的项目在不在这几条上"。

第一层:资产寿命——这是我判断的起点。

评测集      ████████████████████  100% 保值,而且越攒越值钱
prompt      ████████████████░░░░  改改就能用
RAG 索引    ████████████████░░░░  换 embedding 才要重建
微调权重    ░░░░░░░░░░░░░░░░░░░░  0%,基座一换归零

微调权重是唯一换基座带不走的资产。 所以"要不要微调"其实是"愿意把多大比例的投入压在一个会归零的资产上"。这不代表不投,代表要控制比例,且要确保评测集这块不能省。

第二层:被吃掉了什么。

  • 知识注入 → RAG(2023 年就成立)
  • 格式与指令遵循 → 基座能力 + 结构化输出。OpenAI 就是拿这条当收缩微调平台的官方理由:新基座指令与格式遵循大幅提升,prompt 方案更便宜更快,需要微调的用例在变少
  • 推理深度 → effort 档位。答得浅提档位,不是微调
  • (半块)few-shot 示范 → 长上下文 + prompt 缓存

第三层:还剩哪四条护城河。

  1. 成本与延迟的规模化压缩——把大模型能力蒸到小模型上。这是 2026 最主流也最站得住的理由,因为它不依赖"微调让模型更强"这个已经站不住的假设,只依赖"同样的效果我用更小的模型达成"。
  2. 可验证奖励任务上的真实能力增量——任务能写自动判分器、专家答案能收敛。这一档拿到的是 prompt 做不到的能力提升。
  3. 不可言说的隐性风格与判准——写不进 prompt、只能给例子的行业腔调。判据:你写不出规则。
  4. 私有部署与数据主权——数据不能出域、只能跑开源权重。这里没有 effort 档位可提、没有更强的闭源基座可换,微调是唯一手段。这条在国内的金融、政务、医疗场景尤其成立,也是国内微调需求结构性强于海外的原因。

第四层:厂商路线风险,这条在 2026 年必须算进去(截至 2026-08)。

  • OpenAI 正在收缩:2026-05-07 起新组织不能创建微调任务;2026-07-02 起 60 天无推理的组织被关闭;2027-01-06 起存量客户也不能再创建新任务。已训模型可推理至基座下线。
  • Google 出现断档:Gemini 3.x 尚未开放 SFT,而 2.5 Pro 已于 2026-06-17 下线。
  • Anthropic 只有 Bedrock 上 Claude 3 Haiku 一条老路。
  • 开源权重 + 国内云平台 全链路健在。

所以"在闭源 API 上做微调"这件事本身,2026 年已经是一个有路线风险的选择。 我见过一个团队在 Gemini 2.5 Pro 上微调,跑得很好,结果 2.5 Pro 下线而 3.x 没开 SFT,微调资产直接蒸发;回退到"新基座 + 好 prompt"重测,发现只比微调版低 2 个点——微调收益的八成早就被新基座免费送掉了,只是没人定期去测

第五层:所以我的做法是给微调收益设一个定期复查。 每次基座升版,或者至少每季度,用同一份评测集跑三条线:老微调模型 / 新基座 + prompt / 新基座 + 重新微调。三个数一摆,要不要继续投一目了然。这件事的成本几乎为零(评测集是现成的),但绝大多数团队不做,于是只能在基座下线那天才发现问题。

追问链

图 1 · 五层追问树:面试官会往哪儿挖
问的不是微调有没有用,是你的项目在不在剩下的护城河上

  1. 你说微调权重带不走,那具体哪些投入是保值的?

    期望评测集 100% 保值且越攒越值钱(唯一能立刻回答「新模型比旧的好不好」的工具);数据集部分保值,可在新基座上重训、标注不用重做;prompt 改改能用;RAG 索引除非换 embedding 否则无损;只有权重归零
    信号把「数据保值、权重不保值」分开说 → 想清楚了;答「重新训一遍就行」→ 没算重训的评测与验证成本,也没想过可能已经没有微调入口
  2. 那微调还剩哪些场景是新基座吃不掉的?

    期望四条,每条都要带判据而不是罗列场景:① 成本与延迟的规模化压缩 —— 判据是 QPS 与单价;② 可验证奖励任务 —— 能不能写判分器;③ 隐性风格 —— 规则写不写得出;④ 私有部署与数据主权 —— 数据能不能出域
    信号报得出四条并各带判据 → 理解到位;只答「私有化部署还是要微调」→ 只想到最显然的一条
  3. 你怎么量化「我的微调收益还剩多少」?

    期望同一份评测集跑三条线对照:① 老微调模型;② 新基座 + prompt(含 effort 提档);③ 新基座 + 重新微调。差值就是当前微调的真实增量。频率是每次基座升版或每季度。没有评测集就做不了这件事
    信号说得出「三条线对照」这个具体动作 → 真管理过微调资产;只答「重新评估一下」→ 概念正确但没落地
  4. 厂商侧的路线风险你怎么算进选型?

    期望闭源 API 的微调入口厂商随时能收回 —— OpenAI 2027-01-06 起存量客户也不能再建新任务、Gemini 3.x 未开 SFT 而 2.5 Pro 已下线。在闭源上微调要先问:被收回了降级路径是什么?没有就改用开源权重自建,或把方案设计成可退回 prompt
    信号知道 OpenAI 的收缩与 Gemini 的断档 → 在跟厂商路线,2026 年很强的信号;完全不知道 → 知识更新滞后半年以上
  5. 「要不要建微调团队?两个算法 + 一台八卡机,一年两百万。」答不建,业务方说竞品在做,你怎么回?

    期望先反问:几个场景落在那四条护城河上 —— 必须私有部署的客户?QPS 高到蒸馏能省钱的场景?能写判分器的任务?一个都没有就没有稳定的活 → 再算对照:两百万能买多少 API 调用和标注,同样的钱投在评测与数据资产上保值 100%,权重 0 → 分阶段:先不建队,用外部资源做 1–2 个试点,验收写成「相对新基座 + prompt 基线的增量」,三个月后再谈
    信号直接表态「要建」或「不用建」→ 都是没算账;把问题翻译成「我们有几个场景落在护城河上」→ 本题最强信号
这是投资判断题不是知识题:前两层考资产寿命与护城河,第 3 层的「三条线对照」才是分水岭 —— 说不出这个具体动作,后面的账都是估的。

评分要点

  1. 明确知道微调权重换基座归零,其他投入部分保值
  2. 能说出微调被吃掉的至少三块及各自接手方
  3. 能说出四条护城河中的至少三条,且每条带判据
  4. 知道要用评测集做定期对照,而不是凭感觉判断收益
  5. (加分)能说出"三条线对照"的具体做法
  6. (加分)知道 OpenAI 收缩微调平台及关键时点
  7. (加分)知道 Gemini 3.x 的 SFT 断档
  8. (加分)能把厂商路线风险纳入选型
  9. (加分)压力分支里能给出可逆的分阶段方案

常见错误

"有价值啊,微调是深度定制,prompt 比不了"情绪化防守,没有判据。追问"哪个指标上比不了"即崩。
"基座再强也不懂我们的业务数据"把知识问题当微调理由。业务数据该走 RAG。
"基座换了重新微调一遍就行"没算重训成本,更没意识到可能根本没有微调入口了。
"现在都不微调了,全靠 prompt"走到另一个极端,忽略私有部署和成本压缩这两条硬护城河。
"微调的价值在于数据护城河"半对——数据是护城河,权重不是。能区分这两者才算想清楚。
说不出任何量化方法含糊回答的典型形态:有立场没有度量。 追问"你怎么知道还剩多少收益"即见底。
不知道厂商侧正在收缩2026 年下半年的明显减分项,说明信息更新滞后。

关联学习