Agent 成本与延迟优化

Agent 开发进阶18讲解 4

每轮都调大模型,成本与延迟由四类杠杆决定:少调(缓存、语义缓存)、调便宜的(模型路由)、调得短(裁剪上下文与工具结果)、并行。账单暴涨有固定的排查顺序;延迟优化和成本优化不完全同向,流式与首 token 延迟要单独看。

也叫:成本优化 · 延迟优化 · 模型路由 · 语义缓存 · 单位成本 · 账单暴涨

四类杠杆出自 T3-12

① 减少轮数——省的是复利

一轮 = 一次完整的输入重发。少一轮,省的不只是那一轮,还有它之后每一轮都要重发的那部分内容。

  • 工具设计:一个 search_orders(user_id, status, date_range) 顶三次"先查用户→再查订单→再过滤"。合并高频调用序列是最直接的减轮手段(T3-2)。
  • 一次给足信息:把常用的上下文(当前用户、时区、权限范围)在开场就注入,别让模型花一轮去问或去查。
  • 并行工具调用:不减 token,但减墙钟时间(延迟优化,非成本优化)。
  • 该用 workflow 就用 workflow:路径固定的部分不要交给模型现场决策(T3-1)——这是最大的一笔省。

② 稳定前缀,吃满缓存

prompt 缓存的前提是前缀逐字节相同。Agent 场景天然适合缓存(每轮都重发前面所有内容),但也天然容易被破坏:

原文示意
 坏结构                         好结构
[当前时间 2026-08-19 14:23:07]   [system 指令]      ← 稳定
[system 指令]                    [工具定义]         ← 稳定
[工具定义]                       [skills 说明]      ← 稳定
[对话历史]                       [对话历史]         ← 增量追加
                                 [当前时间/动态]    ← 放最后

变的东西一律往后放。 这条规则简单到几乎不像优化,但开篇故障里它值一半的账单。

注意:压缩会打穿缓存T3-6),所以压缩频率和缓存收益要一起算。

③ 裁剪每轮输入

  • 工具返回默认裁剪 + 分页(T3-2);
  • 上下文压缩与结构裁剪(T3-6);
  • 渐进式披露——下一节详讲,这是 2026 年这块最重要的一个范式。

④ 模型分级路由

原文示意
路由决策(小模型或规则)→ 简单意图 → 小模型
                        → 复杂推理 → 大模型
编排器 / 分类 / 摘要 → 小模型
最终综合 / 关键判断  → 大模型

真实收益不小,但风险也最高:路由判断本身可能出错,且错误是隐性的(小模型给出一个看起来合理的错答案)。上线前必须有评测集验证"降级后的质量差多少",并留人工升级通道。

以上节选自T3-12 成本与延迟优化 + Agent Skills——把"什么时候加载"变成架构变量,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到17