LLM 网关:限流与多模型路由

部署与成本进阶6讲解 4

网关是所有模型调用的统一出口,管四笔账:限流(先问你在保护谁 —— 上游配额还是自己的预算)、降级、缓存、路由,外加分账与可观测。两种负载均衡是两个问题:跨 key 摊配额,跨厂商做容灾。能力矩阵易腐化,选型看的是这四笔账谁替你算。

也叫:LLM 网关 · AI Gateway · 限流 · TPM · RPM · 多模型路由 · 分账

核心概念:先打比方,再给定义出自 T6-3

LLM 网关(AI Gateway / LLM Proxy)。所有模型调用的统一出入口,负责鉴权、限流、路由、重试、缓存、观测与分账。像公司的采购部门:业务方不直接找供应商,预算、合同、备选供应商就能集中管理。

三种形态混为一谈是这道题最常见的失分点:

原文示意
A. SDK / 库      进程内调用,零网络跳数,但无法跨服务统一治理
B. 自托管 Proxy  独立进程,统一入口,自己承担单点故障与容量
C. 托管 SaaS     零运维,但 prompt 流经第三方 ← 合规评审的死穴

TPM / ITPM / OTPM。厂商的限流维度不是 QPS,是每分钟 token 数,输入侧输出侧还分开计。一句人话:上游按 token 计费就按 token 限流;用 QPS 近似一个方差三个数量级的变量,一定翻车。

语义缓存(semantic cache)。把问题向量化、比相似度,超阈值就直接返回旧答案,模型根本不跑。区别于 prompt 缓存(prefix caching)——后者是厂商侧复用 KV,模型照常跑、照常生成新输出

模型路由(model routing)。在请求到达模型前判断"这题难不难",简单的送小模型、难的送大的。


技术上只是一跳,价值全在治理
先记住采购部门这个比喻,再记住一件事:上游不按 QPS 计费,按 token

采购部门 · 业务方不直接找供应商

预算、合同、备选供应商集中管理

但采购部门自己也占一道流程 —— 它就长在关键路径上

对应
LLM 网关 · 统一出入口

AI Gateway / LLM Proxy

所有模型调用的统一出入口:鉴权、限流、路由、重试、缓存、观测与分账。三种形态混为一谈是这道题最常见的失分点 —— 托管 SaaS 的死穴是 prompt 流经第三方

SDK / 库自托管 Proxy托管 SaaS
一句人话 · 上游按什么计费就按什么限流

QPS 都是 1,配额消耗差 900 倍

一次 200 token 的分类,和一次 18 万 token 的摘要 —— 用 QPS 近似一个方差三个数量级的变量,一定翻车

对应
TPM / ITPM / OTPM

每分钟 token 数,输入侧输出侧分开计

厂商的限流维度不是 QPS。难的是输出 token 在请求发出前不可知 —— 业界只有三种解,三家厂商的文档合起来正好把三条路各证明了一遍

悲观预扣后验记账预扣 + 回填
最容易混的是这一对:语义缓存比相似度、超阈值就返回旧答案,模型根本不跑;prompt 缓存是厂商侧复用 KV,模型照常跑、照常生成新输出

以上节选自T6-3 LLM 网关:限流、降级、缓存与路由的四笔账,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到5