部署与成本
推理引擎、流式与实时链路、网关、缓存、路由与 token 成本治理。 共 10 个知识点,对应题库第 6 章。
入门1 个
进阶6 个
网关是所有模型调用的统一出口,管四笔账:限流(先问你在保护谁 —— 上游配额还是自己的预算)、降级、缓存、路由,外加分账与可观测。两种负载均衡是两个问题:跨 key 摊配额,跨厂商做容灾。能力矩阵易腐化,选型看的是这四笔账谁替你算。
这笔账有四个维度:单位 token 成本、利用率(自建 GPU 空转就是烧钱)、容量规划与峰谷、人力与运维。throughput 会骗人 —— 要看 goodput,即满足延迟 SLO 的有效吞吐;多数团队在日均量级达到某个阈值前,调 API 更便宜。
KV Cache 的显存 = 2 × 层数 × KV 头数 × 头维度 × 序列长度 × 精度字节 × 并发,序列长度与并发都是线性项,长上下文推理显存爆炸就爆在这里。压它的四条路按成熟度排序: GQA / MLA 减头数、FP8 量化减字节、分页管理减碎片、卸载到主存换带宽。
429 是你超了配额,529 是上游过载 —— 两者的正确反应不同。指数退避带抖动、尊重 retry-after、熔断后 fallback 到备用模型或降级功能、排队降级而不是直接报错;止血优先,先保核心链路再谈体验。
缓存三层:精确缓存、prompt 前缀缓存、语义缓存 —— 每上一层,正确性的责任就往你这边转移一层。语义缓存拿 embedding 相似度当缓存键,FAQ 类高重复问题省大钱,但阈值稍松就误命中答错话;多租户必须隔离,盈亏平衡点要会算。
账单涨了三倍,先切三刀:第一刀输入侧还是输出侧,第二刀各侧内部再切(system 前缀、历史、工具结果、思考 token…),第三刀单价(模型、缓存命中、批处理)。降本动作有完整顺序与代价,四个反直觉的定价事实要记住,成本可观测有最低要求。
深水3 个
两条路:级联 ASR → LLM → TTS 可控、可换件、延迟叠加;端到端语音模型延迟低、能保留语气但黑盒难调。200 毫秒的体感预算逼出 WebRTC、VAD 与 barge-in(打断)这些文本链路没有的问题,三家实时接口的现状易变。
推理瓶颈分两段:prefill 算力密集、decode 带宽密集。PagedAttention 把 KV Cache 按页管理,消灭预分配造成的显存碎片;continuous batching 让请求在 decode 的每一步进出批次,不等最长的那条。chunked prefill 把长 prefill 切片混进 decode 步,平衡两段。
「简单问题走小模型」难在判断什么是简单:规则与分类器都要训练数据,级联(先小后大、小模型不自信再升级)是最稳的形态。大多数团队做不好是因为没有双轴评测 —— 质量与成本要同时量,路由错一次的代价常常大于省下的钱。