怎么考「基座模型半年一大版,你去年微调的模型还有价值吗?微调的护城河在哪?」
谁在问:三面 / 技术负责人 / CTO;考的是技术投资判断而非技术知识
开场怎么问
基座模型迭代这么快,你辛辛苦苦微调的模型,下个版本出来是不是就白做了?
换个问法
- 现在还有微调的必要吗?我看很多能力新模型直接就有了。
- 如果让你决定,我们团队要不要投人做微调?
五层追问链
左边照着问,右边对着听。最后一层是压力面,不必每个候选人都问到。
你说微调权重带不走,那具体哪些投入是保值的?
- 期望
- 评测集 100% 保值且越攒越值钱(它是唯一能立刻回答"新模型比旧的好不好"的工具);数据集本身部分保值(可以在新基座上重训,标注不用重做);prompt 改改能用;RAG 索引除非换 embedding 否则无损;只有权重归零。
- 信号
- 能把"数据保值、权重不保值"分开说——想清楚了。答"重新训一遍就行"——没算重训的评测和验证成本,也没意识到可能没有微调入口。
那微调还剩哪些场景是新基座吃不掉的?
- 期望
- 四条护城河见上。关键是每条都要带判据,而不是罗列场景:成本压缩看 QPS 和单价、可验证奖励看能不能写判分器、隐性风格看规则写不写得出、私有部署看数据能不能出域。
- 信号
- 能报出四条并各带判据——理解到位。只答"私有化部署还是要微调"——只想到最显然的一条。
你怎么量化"我的微调收益还剩多少"?
- 期望
- 用同一份评测集跑三条线对照:① 老微调模型;② 新基座 + prompt(+ effort 提档);③ 新基座 + 重新微调。差值就是当前微调的真实增量。频率是每次基座升版或每季度。没有评测集就做不了这件事——这也是评测集为什么是最值钱资产的实证。
- 信号
- 这一层是本题的核心分水岭。能说出"三条线对照"这个具体动作的,是真管理过微调资产;只答"重新评估一下"的,是概念正确但没落地。
厂商侧的路线风险你怎么算进选型?
- 期望
- 闭源 API 的微调入口是厂商可以随时收回的(OpenAI 2027-01-06 全面停建、Gemini 3.x 断档就是实例)。所以在闭源上微调时要问:这个能力被收回了我怎么办?降级路径是什么?如果答案是"没有降级路径",那这条依赖就要么改用开源权重自建、要么把方案设计成可退回 prompt。
- 信号
- 知道 OpenAI 的收缩和 Gemini 的断档——在跟厂商路线,2026 年很强的信号。完全不知道——知识更新滞后半年以上。
技术负责人问你:"我们要不要组建一支微调团队?两个算法加一台八卡机,一年成本大概两百万。" 你怎么答?如果答不建,业务方说竞品在做,你怎么回?
- 期望
- 先反问业务组合:我们现在有几个场景落在那四条护城河上?特别是——有没有必须私有部署的客户?有没有 QPS 高到蒸馏能省出真金白银的场景?有没有能写判分器的任务?如果一个都没有,这支队伍没有稳定的活。
- 算清楚对照的是什么:两百万一年,能买多少 API 调用、能雇多少标注、能建多少评测集。很多时候同样的钱投在"评测体系 + 数据资产"上,跨基座保值率是 100%,而微调队伍产出的权重保值率是 0。
- 给一个分阶段方案而不是是/否:先不建队伍,用云平台的微调服务或外部资源做 1–2 个试点;试点的验收标准明确写成"相对新基座 + prompt 基线的增量";试点跑三个月,如果增量稳定且有多个场景排队,再谈建队。这样投资是可逆的。
- 对"竞品在做"的回应:竞品对外宣传的"行业大模型"多数包含大量 RAG 和 prompt 工程;对标的应该是他们的业务指标,不是他们的技术名词。可以提议先做一次竞品效果的实测对比,用数据决定要不要跟。
- 保留一条硬理由:如果公司战略里有"必须私有化交付"的客户,那这支队伍的必要性和技术判断无关,是商业约束,该建就建——要能识别出哪些决策不是技术决策。
- 信号
- 直接答"要建,微调是核心能力"或"不用建,现在都用 prompt 了"——两种都是没算账的表态。
- 能把问题翻译成"我们有几个场景落在护城河上"——是本题最强信号,说明他真的在用第三层那四条做决策而不是当知识背。
- 能提"分阶段、可逆"的方案——有投资意识。
- 能识别"私有化交付是商业约束不是技术决策"——层次高于题面。
- 对"竞品在做"只会说"那我们也做"或"他们是在吹"——沟通成熟度不够。
危险信号
听到这些话,基本可以判定是背题而不是做过。
评分卡
- 明确知道微调权重换基座归零,其他投入部分保值
- 能说出微调被吃掉的至少三块及各自接手方
- 能说出四条护城河中的至少三条,且每条带判据
- 知道要用评测集做定期对照,而不是凭感觉判断收益
- (加分)能说出"三条线对照"的具体做法
- (加分)知道 OpenAI 收缩微调平台及关键时点
- (加分)知道 Gemini 3.x 的 SFT 断档
- (加分)能把厂商路线风险纳入选型
- (加分)压力分支里能给出可逆的分阶段方案
参考答案与考察意图面试中途别看这一段
考察意图
这是一道技术投资判断题,不考知识考判断。面试官(通常是技术负责人或三面)在看:
- 有没有资产寿命的概念。知不知道哪些投入随基座蒸发、哪些跨版本保值。
- 能不能给出正向理由而不只是防守。只会说"微调还是有用的"是弱回答;能说清还剩哪几条护城河、每条的判据是什么才是强回答。
- 跟不跟厂商路线。截至 2026-08,闭源侧正在收缩微调入口,这本身就是这道题在 2026 年凭空升值的原因。知道这件事的候选人不多。
参考答案
60 分答案(及格线)
有价值,但价值在缩水。
基座每升一版,通用能力都会提升,去年靠微调获得的一部分优势会被新基座免费送掉。所以微调的收益需要定期重新评估。
不过微调还是有它的场景:私有部署不能用闭源模型的、需要特定风格的、需要把大模型能力压到小模型上降成本的。这些新基座解决不了。
顺序上,应该先看新基座 + 好 prompt 能到什么程度,再决定要不要重新微调。
判断方向对,及格。但"价值在缩水"是定性描述,没有量化方法,也没有厂商路线视角,追问会散。
90 分答案(有生产经验的回答)
先给结论:微调没死,但它的地盘被三面挤压,而且闭源侧正在主动退出。所以这道题的答案不是"有没有价值",是"哪几条还有、你的项目在不在这几条上"。
第一层:资产寿命——这是我判断的起点。
评测集 ████████████████████ 100% 保值,而且越攒越值钱
prompt ████████████████░░░░ 改改就能用
RAG 索引 ████████████████░░░░ 换 embedding 才要重建
微调权重 ░░░░░░░░░░░░░░░░░░░░ 0%,基座一换归零
微调权重是唯一换基座带不走的资产。 所以"要不要微调"其实是"愿意把多大比例的投入压在一个会归零的资产上"。这不代表不投,代表要控制比例,且要确保评测集这块不能省。
第二层:被吃掉了什么。
- 知识注入 → RAG(2023 年就成立)
- 格式与指令遵循 → 基座能力 + 结构化输出。OpenAI 就是拿这条当收缩微调平台的官方理由:新基座指令与格式遵循大幅提升,prompt 方案更便宜更快,需要微调的用例在变少
- 推理深度 → effort 档位。答得浅提档位,不是微调
- (半块)few-shot 示范 → 长上下文 + prompt 缓存
第三层:还剩哪四条护城河。
- 成本与延迟的规模化压缩——把大模型能力蒸到小模型上。这是 2026 最主流也最站得住的理由,因为它不依赖"微调让模型更强"这个已经站不住的假设,只依赖"同样的效果我用更小的模型达成"。
- 可验证奖励任务上的真实能力增量——任务能写自动判分器、专家答案能收敛。这一档拿到的是 prompt 做不到的能力提升。
- 不可言说的隐性风格与判准——写不进 prompt、只能给例子的行业腔调。判据:你写不出规则。
- 私有部署与数据主权——数据不能出域、只能跑开源权重。这里没有 effort 档位可提、没有更强的闭源基座可换,微调是唯一手段。这条在国内的金融、政务、医疗场景尤其成立,也是国内微调需求结构性强于海外的原因。
第四层:厂商路线风险,这条在 2026 年必须算进去(截至 2026-08)。
- OpenAI 正在收缩:2026-05-07 起新组织不能创建微调任务;2026-07-02 起 60 天无推理的组织被关闭;2027-01-06 起存量客户也不能再创建新任务。已训模型可推理至基座下线。
- Google 出现断档:Gemini 3.x 尚未开放 SFT,而 2.5 Pro 已于 2026-06-17 下线。
- Anthropic 只有 Bedrock 上 Claude 3 Haiku 一条老路。
- 开源权重 + 国内云平台 全链路健在。
所以"在闭源 API 上做微调"这件事本身,2026 年已经是一个有路线风险的选择。 我见过一个团队在 Gemini 2.5 Pro 上微调,跑得很好,结果 2.5 Pro 下线而 3.x 没开 SFT,微调资产直接蒸发;回退到"新基座 + 好 prompt"重测,发现只比微调版低 2 个点——微调收益的八成早就被新基座免费送掉了,只是没人定期去测。
第五层:所以我的做法是给微调收益设一个定期复查。 每次基座升版,或者至少每季度,用同一份评测集跑三条线:老微调模型 / 新基座 + prompt / 新基座 + 重新微调。三个数一摆,要不要继续投一目了然。这件事的成本几乎为零(评测集是现成的),但绝大多数团队不做,于是只能在基座下线那天才发现问题。