第 6 章 · 部署与成本
共 10 道。
Q6-01
直接调 API 和自建开源模型推理,这笔账怎么算?
Q6-02
vLLM 为什么快?PagedAttention、continuous batching 解决什么?
Q6-03
KV Cache 是什么?为什么长上下文推理显存爆炸?
Q6-04
流式输出怎么实现?SSE 和 WebSocket 怎么选?
Q6-05
实时语音链路怎么搭?级联 ASR→LLM→TTS 和端到端语音模型的取舍?
Q6-06
什么是 LLM 网关?限流、降级、多模型路由怎么设计?
Q6-07
语义缓存是什么?什么场景省大钱、什么场景会答错话?
Q6-08
模型路由(简单问题走小模型)怎么判断「简单」?
Q6-09
应用 token 成本突然涨了 3 倍,怎么排查和治理?
Q6-10
高峰期上游 API 限流了,你的应用怎么优雅降级?