模型路由(简单问题走小模型)怎么判断「简单」?

Q6-08模型路由与难度判定常见模型路由级联难度判定分类器effort档位双轴评测

谁在问:平台组 / 网关团队;有多模型池且被成本考核的中台组、做 AI 基础设施的公司

口语化问法

  • 简单问题走小模型、复杂问题走大模型,这个'简单'你怎么判断?
  • 你们做过模型路由吗?省了多少?怎么验证路由没有把质量拉低?
  • 2026 年模型本身都有 effort 档位了,还需要跨模型路由吗?

考察意图

表面是算法问题,实际考的是成本与质量取舍的成熟度。面试官在判断:

  1. 你有没有意识到错路由的代价是不对称的——这是核心,也是绝大多数回答缺失的一环。
  2. 你会不会被"能省 85%"这类数字带跑——那个被引烂的数字有严格定义,直接引用等于没读过原文。
  3. 你知不知道什么时候不该做路由——2026 年最有区分度的答案往往是"我们评估之后没做",而且给得出四条判据。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

判断"简单"大致有三类方法:

  • 基于规则:按任务类型分流——分类、抽取、格式转换走小模型,推理、代码、长文分析走大模型;也可以按输入长度或用户等级分。
  • 基于分类器:训练一个小模型给难度打分,超过阈值就升级。训练数据从历史调用里拿——两个模型都跑一遍,看小模型什么时候答得跟大模型一样好。
  • 级联:先用小模型跑,结果不满意再升级。判断"不满意"可以看模型自己的置信度,或者用校验器。

收益上,公开研究说在保持 95% 质量的前提下能省 85% 左右。代价主要是多一层路由延迟,以及路由器本身可能判错。

实践上我会先从规则开始,可解释好调试,积累了数据再考虑上分类器。

为什么只有 60 分:方法分类对,"先规则后分类器"也务实。但有三个硬伤——直接引用"省 85%"却不知道它的定义把模型自评置信度当成可用的升级信号(已被证伪);完全没有"错路由代价不对称"这一层,也就解释不了"为什么路由在生产上很难做好"。

90

90 分答案(有生产经验的回答)

先把那个"省 85%"说清楚。 "保持 95% 质量"指的是 PGR——补回强弱模型之间差距的 95%,不是绝对准确率;强弱模型差距越小它越容易达到、也越没意义。更关键的是它随分布外衰减剧烈:分布内只需 14% 的强模型调用,分布外即使加了标注仍需 54%。所以路由收益高度依赖你自己的流量分布,别人的百分比没有参考价值。

判定方法按可用性排:

  1. 规则与元数据——任务类型、输入长度、租户等级、场景标签。零训练、可解释、可审计、几乎零延迟,这是我唯一会无条件推荐的一类
  2. 分类器打分——小模型给难度打分。数据来源有人类偏好对、大模型判分造标、有标准答案的数据集;前面"14% 对 54%"就说明了数据来源决定路由收益
  3. 相似度与最近邻——按历史相似问题的表现路由,延迟最低(十几毫秒量级)。
  4. 级联——先小模型跑、不行再升级。收益上限最高,但延迟叠加,且有结构性弱点:一旦请求在早期被过滤掉,更强的模型就没机会纠正了
  5. 模型自评置信度——直接排除。 校准度普遍很差,"它说自己有 90% 把握"和实际正确率几乎脱钩。要用外部质量估计器或结构化验证。

然后是最重要的一点:错路由的代价是高度不对称的。 把简单题送给贵模型,损失是线性的、可预算的、用户看不见的——就是多花几倍钱;把难题送给小模型,损失是非线性的、不可预算的、用户直接能看见的——错答案、返工、信任受损,Agent 场景下还会级联放大。

这个不对称直接决定了路由的失败模式。 2026 年的路由基准里最好的路由器距理论上限还差 17 个百分点,共性失败原因写得很直白——它们不擅长识别"什么时候小模型就够了"。多数路由器聚集在"接近 100% 成本、接近 100% 准确率",等于把收益全吃掉了;甚至有基准测出某商用路由服务相对"永远用最强单模型"是 −24.7%。

应对三条: 阈值做成不对称的(宁可多花钱也别答错);按业务后果分级——可撤销的操作可以激进路由,不可撤销的一律走强模型;用级联兜底而不是一次性路由。

两个必须知道的工程事实:路由延迟跨两个数量级,从 11 毫秒(轻量分类器、最近邻)到 500 毫秒以上(用大模型做判断),超过 100 毫秒就威胁 SLO——部署前必须先问"路由器本身要多久";② "路由会打穿 prompt 缓存"已被实测证伪——真实流量近五千次模型切回中,一小时 TTL 下 99.3% 的缓存仍是热的;真正的风险是无粘性的无状态路由 + 短 TTL。反过来的对照更有说服力:只路由不缓存比"单模型 + 缓存"还贵约 4 倍。

最后是选型判断,2026 年这道题的正确答案往往是"先别做"。 四条判据:日调用量小;难度分布单一(路由的前提是有方差);prompt 缓存和 effort 档位还没做满(缓存读比未缓存输入便宜 75% 到 90% 且零风险);没有能同时评质量和成本的双轴评测——没有它你根本无法判断路由是赚是赔

有团队公开写过下线自建路由的复盘,核心理由值得记住:判断难度所需的信息是在执行过程中产生的,而不是在执行之前就能拿到。 同样一句"评估一下这些测试",简单 HTML 是琐事、大型代码仓库是极难——prompt 可以一模一样

至于 effort 档位是否让路由变得不必要: effort 是模型内路由,跨模型路由是模型间路由,解的是同一个问题。档位的优势是无路由器延迟、无选错模型的风险、可解释可回滚;但它换不来跨模型价差(旗舰到最小模型是 10 到 80 倍)。而且档位也不免费——动态调 effort 会让 prompt 缓存在消息层失效,所以"逐请求动态调档"和"高缓存命中率"互相打架。

正确的顺序是:精确缓存 → prompt 缓存 → effort 档位 →(确认难度分布有方差且有双轴评测之后)跨模型路由 → 级联。

追问链

图 1 · 五层追问树:面试官会往哪儿挖
错路由的代价是不对称的 —— 五层追问全绕着这一条

  1. 你说分类器的训练数据决定收益,具体怎么造这批数据?

    期望按成本递增:① 双跑对比 —— 真实流量同跑强弱两模型比输出,弱模型答得一样好的就是「简单」样本;② 大模型成对判分造标,要校准位置与冗长偏差;③ 有标准答案的数据集,可靠但覆盖窄。训练分布决定适用边界 —— 分布内 14%、分布外 54% 就是量化
    信号提「双跑对比 + 用自己的真实流量」 → 真做过;只说「标注一批难度标签」 → 没想清楚标签从哪来
  2. 路由上线之后,你怎么验证它没有把质量拉低?

    期望必须双轴 —— 只看成本得「路由很成功」,只看质量得「路由没必要」。离线三条对照:全强、全弱、路由,看是否落在帕累托前沿;在线 A/B 做配对检验(n=100、基线 80% 时区间 ±7.8 个百分点);分层盯被降级的那批难题 —— 总体分不动,这一小撮已经崩
    信号主动提「三条对照 + 分层看被降级的那批」 → 真验证过;只说「看总体分数没掉」 → 会漏掉不对称损失
  3. 级联和一次性路由,你会选哪个?

    期望一次性路由延迟可控但错了无补救;级联上限更高,代价是延迟叠加、判定器要可靠,以及早期被判「已解决」就再没机会纠正这个结构性弱点。按后果分级:可撤销的走级联,不可撤销的直接走强模型;升级判据要用外部信号 —— 结构化校验、检索一致性、格式合法性
    信号说得出「级联的早期过滤不可逆」 → 想过失败模式;能按业务后果分级 → 有生产判断
  4. 现在模型都有 effort 档位了,还需要跨模型路由吗?

    期望档位是模型内路由、跨模型是模型间路由,解的是同一个问题。档位胜在零路由延迟、无选错风险、可一键回滚;局限是旗舰到最小模型 10 到 80 倍的价差它换不来,且动态改 effort 会让 prompt 缓存失效。顺序:档位先做,路由只在调到最低仍太贵时才上
    信号给出「模型内 vs 模型间」框架、并说出档位换不来价差 → 理解透了;答「有 effort 就不用路由」或「两者没关系」 → 都只对一半
  5. 路由三个月降本 35%,客诉率却涨了 20%,业务要回滚、老板要保收益,你怎么办?

    期望先止血且可逆:调阈值到最保守而非下线系统 —— 配置几分钟生效,发布回不去 → ② 归因不猜:拉投诉样本看落在哪一档,判错 / 能力边界 / 与路由无关分开 → ③ 分层退出代替回滚:不可撤销、投诉集中的退出路由,低风险高重复的保留 → ④ 三档摆一张表交回决策:−12%、−22% 客诉 +5%、−35% 客诉 +20%
    信号第一动作是「调阈值」而不是「下线系统」 → 懂可逆性;用分层退出保住大部分收益、并反思「上线时只有单轴指标」 → 有职业成熟度
面试官要的是代价不对称这层意识:贵模型跑简单题只是多花钱,小模型接难题是用户直接看得见的错答。第 5 层把它变成钱和客诉的对账,会分层退出的才过关。

评分要点

  1. 知道 "95% 质量"是 PGR 不是绝对准确率,且收益随分布外衰减
  2. 判定方法分类清晰,明确排除模型自评置信度并说得出原因
  3. 讲出错路由代价的不对称,并给出应对(不对称阈值、按后果分级、级联兜底)
  4. 知道路由的失败模式是**"不敢用小模型"**
  5. 知道路由延迟跨两个数量级,超过 100 毫秒威胁 SLO
  6. 知道**"路由打穿缓存"已被证伪**,真正的风险是无粘性 + 短 TTL
  7. 说得出四条"不该做路由"的判据
  8. 用"模型内 vs 模型间"框架回答 effort 与路由的关系,指出档位换不来跨模型价差
  9. 验证方案是双轴的,且知道要分层看被降级的那批流量
  10. 压力面下用"调阈值 + 分层退出"代替"全量回滚"

常见错误

直接引用"能省 85%",不知道那是 PGR 的定义,也不知道它随分布外剧烈衰减。
用模型自评置信度做升级判据——已被证伪,模型的校准度普遍很差。
完全不提代价的不对称性。这是最核心的一层,缺了它就解释不了"为什么路由普遍做不好"。
"路由会打穿 prompt 缓存所以不能做"——方向对但结论过时,实测下会话粘性能保住九成以上。
不问路由器本身的延迟。一个 500 毫秒的路由器能把节省的钱以体验的形式全赔回去。
只用成本一个轴验收——绝大多数路由项目翻车的直接原因。
含糊表述:"我们用大模型判断难度再分发"——延迟和成本都上去了,很可能是负收益。
认为"只降一档"就有收益。旗舰到次旗舰只有 2.5 到 3 倍价差,算上路由器成本与风险往往不划算。
不知道路由需要会话级粘性。无状态路由让同一会话在模型间跳来跳去,既打散缓存也让输出风格漂移。

关联学习