上下文工程
上下文工程是为每一次推理策展并维护一组最优 token,覆盖提示词之外所有会落进窗口的东西。把窗口当注意力预算来花:固定开销尽量薄、用渐进披露把冷门内容挪出去,写入 / 选择 / 压缩 / 隔离四种操作是它的基本工具箱;提示词工程只是它的一个子集。
也叫:上下文工程 · context engineering · 注意力预算 · 渐进披露 · progressive disclosure
再学Agent 记忆系统AI 编程协作:工作流与人的位置Context rot 与长上下文衰减AI 编程的上下文构建上下文压缩 compaction并行调用与工具结果治理Agent Skills 与渐进式披露
核心概念:先打比方,再给定义出自 T1-3
Context engineering(上下文工程)。官方定义的意思是:为模型的每一次推理策展并维护一组最优的 token,包括提示词之外所有可能落进上下文的信息——系统提示词、工具定义、检索结果、对话历史、外部记忆、按需加载的文档。
Context rot(上下文腐烂)。随着上下文里 token 数上升,模型从中准确召回信息的能力下降。所有模型都有这个特性,只是衰减快慢不同。
Attention budget(注意力预算)。本篇最重要的心智模型:上下文不是硬盘,是一份有限且边际递减的预算。
比喻:给你一张桌子和一叠资料。桌子再大,你能同时看清的纸也就那么几张。往桌上多摊 200 页,不会让你更懂,只会让你更难找到那一页。
上下文不是硬盘,是一份有限且边际递减的预算 —— 本篇最重要的心智模型
桌面 · 摊得下多少纸
对应桌子够大,一叠资料全摊得下
摊得下不等于看得清 —— 桌面大小只是必要条件
上下文窗口 · 容量
100 万 token 装得下整本手册
「窗口能装下」和「装进去还管用」是两回事,前者只是门槛
system工具定义检索结果对话历史
眼睛 · 同时看清几张
对应你能同时看清的纸就那么几张
多摊 200 页不会让你更懂,只会让你更难找到那一页
Attention budget · 注意力预算
有限、且边际递减的一份预算
token 数一上升,模型从中准确召回信息的能力就下降 —— 这就是 context rot
所有模型都有只是衰减快慢不同
官方定义里 context engineering 的动词是「策展」:为每一次推理策展并维护一组最优 token,管的是提示词之外所有会落进上下文的东西 —— 工具定义、检索结果、对话历史、外部记忆、按需加载的文档。
以上节选自T1-3 上下文工程与 context rot:把窗口当注意力预算来花,读全文能看到前后语境。
延伸阅读
考这个知识点的题1 道
会连带问到7 道
- Q1-04system prompt 和 user prompt 有什么区别?为什么指令要放 system?
- Q1-12什么是 context rot?为什么上下文越长模型反而变笨?
- Q2-02有了百万级长上下文,为什么还要 RAG?「RAG 已死」你怎么看?
- Q3-12Agent 的记忆系统怎么设计?短期、长期记忆分别放哪?
- Q3-17LangGraph / OpenAI Agents SDK / ADK / CrewAI 怎么选?为什么不少团队最后自己写循环?
- Q7-01你平时怎么用 AI 写代码?讲一个省了一天的例子和一个翻车的例子
- Q7-02给 AI 编程工具喂上下文有什么讲究?为什么整仓塞进去反而更差?