LLM 网关:限流与多模型路由
网关是所有模型调用的统一出口,管四笔账:限流(先问你在保护谁 —— 上游配额还是自己的预算)、降级、缓存、路由,外加分账与可观测。两种负载均衡是两个问题:跨 key 摊配额,跨厂商做容灾。能力矩阵易腐化,选型看的是这四笔账谁替你算。
也叫:LLM 网关 · AI Gateway · 限流 · TPM · RPM · 多模型路由 · 分账
核心概念:先打比方,再给定义出自 T6-3
LLM 网关(AI Gateway / LLM Proxy)。所有模型调用的统一出入口,负责鉴权、限流、路由、重试、缓存、观测与分账。像公司的采购部门:业务方不直接找供应商,预算、合同、备选供应商就能集中管理。
三种形态混为一谈是这道题最常见的失分点:
A. SDK / 库 进程内调用,零网络跳数,但无法跨服务统一治理 B. 自托管 Proxy 独立进程,统一入口,自己承担单点故障与容量 C. 托管 SaaS 零运维,但 prompt 流经第三方 ← 合规评审的死穴
TPM / ITPM / OTPM。厂商的限流维度不是 QPS,是每分钟 token 数,输入侧输出侧还分开计。一句人话:上游按 token 计费就按 token 限流;用 QPS 近似一个方差三个数量级的变量,一定翻车。
语义缓存(semantic cache)。把问题向量化、比相似度,超阈值就直接返回旧答案,模型根本不跑。区别于 prompt 缓存(prefix caching)——后者是厂商侧复用 KV,模型照常跑、照常生成新输出。
模型路由(model routing)。在请求到达模型前判断"这题难不难",简单的送小模型、难的送大的。
预算、合同、备选供应商集中管理
但采购部门自己也占一道流程 —— 它就长在关键路径上
AI Gateway / LLM Proxy
所有模型调用的统一出入口:鉴权、限流、路由、重试、缓存、观测与分账。三种形态混为一谈是这道题最常见的失分点 —— 托管 SaaS 的死穴是 prompt 流经第三方
QPS 都是 1,配额消耗差 900 倍
一次 200 token 的分类,和一次 18 万 token 的摘要 —— 用 QPS 近似一个方差三个数量级的变量,一定翻车
每分钟 token 数,输入侧输出侧分开计
厂商的限流维度不是 QPS。难的是输出 token 在请求发出前不可知 —— 业界只有三种解,三家厂商的文档合起来正好把三条路各证明了一遍
以上节选自T6-3 LLM 网关:限流、降级、缓存与路由的四笔账,读全文能看到前后语境。