6 章 · 部署与成本

10 道。

Q6-01
直接调 API 和自建开源模型推理,这笔账怎么算?
推理服务选型与成本核算高频
Q6-02
vLLM 为什么快?PagedAttention、continuous batching 解决什么?
推理引擎原理常见
Q6-03
KV Cache 是什么?为什么长上下文推理显存爆炸?
KV Cache 与长上下文显存高频
Q6-04
流式输出怎么实现?SSE 和 WebSocket 怎么选?
流式输出与传输协议高频
Q6-05
实时语音链路怎么搭?级联 ASR→LLM→TTS 和端到端语音模型的取舍?
实时语音链路架构进阶
Q6-06
什么是 LLM 网关?限流、降级、多模型路由怎么设计?
LLM 网关架构高频
Q6-07
语义缓存是什么?什么场景省大钱、什么场景会答错话?
语义缓存常见
Q6-08
模型路由(简单问题走小模型)怎么判断「简单」?
模型路由与难度判定常见
Q6-09
应用 token 成本突然涨了 3 倍,怎么排查和治理?
Token 成本排查与治理高频
Q6-10
高峰期上游 API 限流了,你的应用怎么优雅降级?
限流应对与优雅降级高频