模型路由与难度判定
「简单问题走小模型」难在判断什么是简单:规则与分类器都要训练数据,级联(先小后大、小模型不自信再升级)是最稳的形态。大多数团队做不好是因为没有双轴评测 —— 质量与成本要同时量,路由错一次的代价常常大于省下的钱。
也叫:模型路由 · 级联 · cascade · 难度判定 · 路由分类器 · effort 档位
四、路由:怎么判断"简单",以及为什么大多数团队做不好出自 T6-3
判定方法五类,从便宜到贵:规则与元数据(任务类型、输入长度、租户等级)、分类器打分、相似度与最近邻、级联(先小模型跑,不行再升级)、模型自评置信度。最后一类要直接排除——模型校准度普遍很差,"它说自己有 90% 把握"和实际正确率几乎脱钩。不要拿"模型说自己不确定"当升级信号,要用外部质量估计器或结构化验证。
四个必须校正的认知:
① "95% 质量"不是绝对准确率,指的是补回强弱模型之间差距的 95%。且收益随分布外衰减剧烈:分布内只需 14% 的强模型调用,分布外即使加了标注仍需 54%。
② 路由的失败模式是"不敢用小模型"。 2026 年的路由基准里最好的路由器距理论上限还差 17 个百分点,共性失败原因写得很直白:不擅长识别"什么时候小模型就够了"。多数路由器聚集在"接近 100% 成本、接近 100% 准确率"——等于把收益全吃掉了。根因是错路由代价高度不对称:简单题送贵模型,损失线性可预算、用户看不见;难题送小模型,损失非线性、用户直接能看见。所以生产路由器必然偏保守,甚至有基准测出某商用路由相对最强单模型是 −24.7%。
③ 路由延迟跨两个数量级(11 到 547 毫秒),超过 100 毫秒就威胁 SLO。部署前必须先问"路由器本身要多久"。
④ "路由会打穿 prompt 缓存"已被实测证伪(真实流量近五千次模型切回中,一小时 TTL 下 99.3% 的缓存仍是热的),真正的风险是无粘性的无状态路由 + 短 TTL。反过来的对照更有说服力:只路由不缓存比"单模型 + 缓存"还贵约 4 倍。
什么时候不该做路由:日调用量小;流量难度分布单一(路由的前提是有方差);prompt 缓存与 effort 档位还没做满(缓存读比未缓存输入便宜 75%–90% 且零风险);没有质量与成本的双轴评测。
有团队公开写过下线自建路由的复盘,核心理由值得记住:判断难度所需的信息是在执行过程中产生的,而不是执行之前就能拿到。 同样一句"评估一下这些测试",简单 HTML 是琐事、大型代码仓库是极难——prompt 可以一模一样。
以上节选自T6-3 LLM 网关:限流、降级、缓存与路由的四笔账,读全文能看到前后语境。
考这个知识点的题1 道
会连带问到10 道
- Q1-07推理模型(thinking 类)和普通模型有什么区别?什么任务值得用?
- Q3-23Agent 每轮都调大模型,太贵太慢,成本和延迟怎么优化?
- Q4-10什么是蒸馏?用大模型造数据训小模型要注意什么(含合规)?
- Q6-02vLLM 为什么快?PagedAttention、continuous batching 解决什么?
- Q6-06什么是 LLM 网关?限流、降级、多模型路由怎么设计?
- Q6-07语义缓存是什么?什么场景省大钱、什么场景会答错话?
- Q6-09应用 token 成本突然涨了 3 倍,怎么排查和治理?
- Q6-10高峰期上游 API 限流了,你的应用怎么优雅降级?
- Q8-09你的方案预算砍一半,先砍什么?
- Q8-10系统日活从 100 涨到 10 万,架构要变什么?