上下文工程

LLM 与 Prompt 基础进阶8讲解 2

上下文工程是为每一次推理策展并维护一组最优 token,覆盖提示词之外所有会落进窗口的东西。把窗口当注意力预算来花:固定开销尽量薄、用渐进披露把冷门内容挪出去,写入 / 选择 / 压缩 / 隔离四种操作是它的基本工具箱;提示词工程只是它的一个子集。

也叫:上下文工程 · context engineering · 注意力预算 · 渐进披露 · progressive disclosure

核心概念:先打比方,再给定义出自 T1-3

Context engineering(上下文工程)。官方定义的意思是:为模型的每一次推理策展并维护一组最优的 token,包括提示词之外所有可能落进上下文的信息——系统提示词、工具定义、检索结果、对话历史、外部记忆、按需加载的文档。

Context rot(上下文腐烂)。随着上下文里 token 数上升,模型从中准确召回信息的能力下降。所有模型都有这个特性,只是衰减快慢不同。

Attention budget(注意力预算)。本篇最重要的心智模型:上下文不是硬盘,是一份有限且边际递减的预算

比喻:给你一张桌子和一叠资料。桌子再大,你能同时看清的纸也就那么几张。往桌上多摊 200 页,不会让你更懂,只会让你更难找到那一页。

桌子再大,同时看清的就那么几张
上下文不是硬盘,是一份有限且边际递减的预算 —— 本篇最重要的心智模型

桌面 · 摊得下多少纸

桌子够大,一叠资料全摊得下

摊得下不等于看得清 —— 桌面大小只是必要条件

对应
上下文窗口 · 容量

100 万 token 装得下整本手册

「窗口能装下」和「装进去还管用」是两回事,前者只是门槛

system工具定义检索结果对话历史
眼睛 · 同时看清几张

你能同时看清的纸就那么几张

多摊 200 页不会让你更懂,只会让你更难找到那一页

对应
Attention budget · 注意力预算

有限、且边际递减的一份预算

token 数一上升,模型从中准确召回信息的能力就下降 —— 这就是 context rot

所有模型都有只是衰减快慢不同
官方定义里 context engineering 的动词是「策展」:为每一次推理策展并维护一组最优 token,管的是提示词之外所有会落进上下文的东西 —— 工具定义、检索结果、对话历史、外部记忆、按需加载的文档。

以上节选自T1-3 上下文工程与 context rot:把窗口当注意力预算来花,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到7