模型路由与难度判定

部署与成本深水11讲解 1

「简单问题走小模型」难在判断什么是简单:规则与分类器都要训练数据,级联(先小后大、小模型不自信再升级)是最稳的形态。大多数团队做不好是因为没有双轴评测 —— 质量与成本要同时量,路由错一次的代价常常大于省下的钱。

也叫:模型路由 · 级联 · cascade · 难度判定 · 路由分类器 · effort 档位

四、路由:怎么判断"简单",以及为什么大多数团队做不好出自 T6-3

判定方法五类,从便宜到贵:规则与元数据(任务类型、输入长度、租户等级)、分类器打分相似度与最近邻级联(先小模型跑,不行再升级)、模型自评置信度。最后一类要直接排除——模型校准度普遍很差,"它说自己有 90% 把握"和实际正确率几乎脱钩。不要拿"模型说自己不确定"当升级信号,要用外部质量估计器或结构化验证。

四个必须校正的认知:

① "95% 质量"不是绝对准确率,指的是补回强弱模型之间差距的 95%。且收益随分布外衰减剧烈:分布内只需 14% 的强模型调用,分布外即使加了标注仍需 54%。

② 路由的失败模式是"不敢用小模型"。 2026 年的路由基准里最好的路由器距理论上限还差 17 个百分点,共性失败原因写得很直白:不擅长识别"什么时候小模型就够了"。多数路由器聚集在"接近 100% 成本、接近 100% 准确率"——等于把收益全吃掉了。根因是错路由代价高度不对称:简单题送贵模型,损失线性可预算、用户看不见;难题送小模型,损失非线性、用户直接能看见。所以生产路由器必然偏保守,甚至有基准测出某商用路由相对最强单模型是 −24.7%。

③ 路由延迟跨两个数量级(11 到 547 毫秒),超过 100 毫秒就威胁 SLO。部署前必须先问"路由器本身要多久"。

④ "路由会打穿 prompt 缓存"已被实测证伪(真实流量近五千次模型切回中,一小时 TTL 下 99.3% 的缓存仍是热的),真正的风险是无粘性的无状态路由 + 短 TTL。反过来的对照更有说服力:只路由不缓存比"单模型 + 缓存"还贵约 4 倍。

什么时候不该做路由:日调用量小;流量难度分布单一(路由的前提是有方差);prompt 缓存与 effort 档位还没做满(缓存读比未缓存输入便宜 75%–90% 且零风险);没有质量与成本的双轴评测。

有团队公开写过下线自建路由的复盘,核心理由值得记住:判断难度所需的信息是在执行过程中产生的,而不是执行之前就能拿到。 同样一句"评估一下这些测试",简单 HTML 是琐事、大型代码仓库是极难——prompt 可以一模一样


以上节选自T6-3 LLM 网关:限流、降级、缓存与路由的四笔账,读全文能看到前后语境。

考这个知识点的题1

会连带问到10