部署与成本

推理引擎、流式与实时链路、网关、缓存、路由与 token 成本治理。10 个知识点,对应题库6

入门1

进阶6

进阶6
LLM 网关:限流与多模型路由

网关是所有模型调用的统一出口,管四笔账:限流(先问你在保护谁 —— 上游配额还是自己的预算)、降级、缓存、路由,外加分账与可观测。两种负载均衡是两个问题:跨 key 摊配额,跨厂商做容灾。能力矩阵易腐化,选型看的是这四笔账谁替你算。

进阶7
自建推理还是调 API:成本账

这笔账有四个维度:单位 token 成本、利用率(自建 GPU 空转就是烧钱)、容量规划与峰谷、人力与运维。throughput 会骗人 —— 要看 goodput,即满足延迟 SLO 的有效吞吐;多数团队在日均量级达到某个阈值前,调 API 更便宜。

进阶7
KV Cache 显存账与长上下文

KV Cache 的显存 = 2 × 层数 × KV 头数 × 头维度 × 序列长度 × 精度字节 × 并发,序列长度与并发都是线性项,长上下文推理显存爆炸就爆在这里。压它的四条路按成熟度排序: GQA / MLA 减头数、FP8 量化减字节、分页管理减碎片、卸载到主存换带宽。

进阶6
限流应对与优雅降级

429 是你超了配额,529 是上游过载 —— 两者的正确反应不同。指数退避带抖动、尊重 retry-after、熔断后 fallback 到备用模型或降级功能、排队降级而不是直接报错;止血优先,先保核心链路再谈体验。

进阶9
语义缓存

缓存三层:精确缓存、prompt 前缀缓存、语义缓存 —— 每上一层,正确性的责任就往你这边转移一层。语义缓存拿 embedding 相似度当缓存键,FAQ 类高重复问题省大钱,但阈值稍松就误命中答错话;多租户必须隔离,盈亏平衡点要会算。

进阶16
Token 成本三刀归因

账单涨了三倍,先切三刀:第一刀输入侧还是输出侧,第二刀各侧内部再切(system 前缀、历史、工具结果、思考 token…),第三刀单价(模型、缓存命中、批处理)。降本动作有完整顺序与代价,四个反直觉的定价事实要记住,成本可观测有最低要求。

深水3