Harness 治理
Agent 的能力一半在模型、一半在 harness:提示词、工具集、循环策略、护栏这些模型之外的东西。模型换代时 harness 里为旧模型打的补丁会变成债务,治理的核心动作是做减法与提示词版本化,多 Agent 场景下还要多一层跨 Agent 的一致性约束。
也叫:Harness 治理 · harness · harness 债务 · 提示词版本化 · 模型换代
Harness 治理:为什么说能力一半不在模型里出自 T3-10
2026 年这个说法之所以被广泛接受,是因为有很直接的经验证据:同一个模型、同一套任务,仅仅改变 harness 层的某个设计,成功率可以发生数量级变化。
一个被反复引用的例子:某编码 Agent 在不更换模型的前提下,仅把文件编辑的接口格式从一种改成另一种,任务成功率就从个位数百分比提升到六成以上(第三方实测,仅作量级示意,不同任务差异很大)。模型一个字没改。
这解释了 harness 为什么是 2026 年的工程焦点:当各家模型的基础能力趋近时,决定产品质量的变量转移到了模型之外的那一层——工具接口设计、上下文管理、验证与反馈回路、权限与审计。业界有一句流传很广的概括:模型是商品,harness 才是护城河。
学术侧也开始系统化:2026 年 4 月出现了首个 Agent Harness 的系统性综述,分析了 20 余个代表性系统,提出了 harness 的六组件形式化框架,并识别出若干开放挑战。同时它给出了一个重要的反向判断:随着模型变强,harness 会变薄,但不会消失——再强的模型也需要有东西来管理它的上下文、执行工具调用、持久化状态、验证结果。
面试里回答 Q3-20 时,能同时给出"harness 决定一半能力"和"harness 会变薄"两个方向的判断,比只会喊口号强得多。
以上节选自T3-10 护栏、分级自治与 Harness 治理——能力的另一半不在模型里,读全文能看到前后语境。
延伸阅读
考这个知识点的题1 道
会连带问到9 道
- Q3-01什么是 Agent?和 workflow、和「调用一次大模型」的本质区别?
- Q3-04工具的 schema 和描述怎么设计,模型才能选得准、填得对?
- Q3-10接入第三方 MCP Server 有什么安全风险?工具投毒、越权怎么防?
- Q3-11A2A 协议解决什么问题?和 MCP 是竞争还是互补?
- Q3-17LangGraph / OpenAI Agents SDK / ADK / CrewAI 怎么选?为什么不少团队最后自己写循环?
- Q3-18Agent 跑偏或幻觉了怎么办?护栏在架构里放哪几层?
- Q3-19什么是分级自治?高危操作(写库 / 发邮件 / 付款)怎么设计人工确认?
- Q3-24Agent Skills 是什么?和把说明全写进 system prompt 有什么区别?渐进式披露解决什么?
- Q7-06团队有人 vibe coding 上瘾、代码没人看得懂,你怎么立规矩?