分级自治与人工确认
分级按不可逆性,不按重要性:读操作全自动,可撤销的写操作自动执行 + 撤销窗口,不可逆的高危操作(付款、发邮件、删库)必须人工确认。确认要设计得不流于形式 —— 确认疲劳会让人闭眼点通过;影子模式与审计记录是上线前后的两道保险。
也叫:分级自治 · 人工确认 · human-in-the-loop · 确认疲劳 · 可撤销窗口 · 影子模式
先学护栏与可靠性
再学人机协同与转人工
分级自治:按不可逆性分级,不是按重要性出自 T3-10
分级的标准很多人会写成"重要程度",那是主观的、无法落到代码里的。正确的分级维度是不可逆性和影响半径:
| 级别 | 动作特征 | 例子 | 自治策略 |
|---|---|---|---|
| L0 只读 | 无副作用,可无限重试 | 查订单、检索文档 | 全自动 |
| L1 可逆写 | 有副作用但可撤销,影响自己 | 存草稿、建标签、改内部状态 | 全自动 + 审计留痕 |
| L2 不可逆写 | 撤销困难或有成本 | 删数据、改生产配置、写外部系统 | 人工确认或严格前置校验 + 可回滚设计 |
| L3 对外 / 资金 | 影响他人、涉及钱,撤销代价极高 | 发邮件给客户、退款、下单、发布 | 强制人工确认 + 双重限额 + 全量审计 |
批量操作要单独一档:单笔 L1 的动作,批量 100 次可能等价于 L3。所以"批量阈值"必须是一个独立护栏——超过 N 条就升级审批,这是开篇故障最直接的补丁。
以上节选自T3-10 护栏、分级自治与 Harness 治理——能力的另一半不在模型里,读全文能看到前后语境。
延伸阅读
考这个知识点的题1 道
会连带问到24 道
- Q1-10怎么让模型稳定输出合法 JSON?结构化输出的几种实现与兜底策略?
- Q1-15什么是提示词注入?你的应用怎么防?
- Q3-01什么是 Agent?和 workflow、和「调用一次大模型」的本质区别?
- Q3-04工具的 schema 和描述怎么设计,模型才能选得准、填得对?
- Q3-10接入第三方 MCP Server 有什么安全风险?工具投毒、越权怎么防?
- Q3-11A2A 协议解决什么问题?和 MCP 是竞争还是互补?
- Q3-18Agent 跑偏或幻觉了怎么办?护栏在架构里放哪几层?
- Q3-20什么是 Harness 治理?为什么说 Agent 的能力一半在模型一半在 harness?
- Q3-21Agent 怎么评测?只看最终结果不看轨迹会漏掉什么?
- Q3-24Agent Skills 是什么?和把说明全写进 system prompt 有什么区别?渐进式披露解决什么?
- Q3-25从零设计一个能查库存、能下单的电商客服 Agent,讲讲整体架构
- Q4-11微调后"学会了新任务但变笨了"怎么办?
- Q5-03LLM-as-Judge 是什么?它自己有哪些偏差?怎么校准?
- Q6-06什么是 LLM 网关?限流、降级、多模型路由怎么设计?
- Q6-08模型路由(简单问题走小模型)怎么判断「简单」?
- Q6-10高峰期上游 API 限流了,你的应用怎么优雅降级?
- Q7-03复杂任务怎么拆给 AI?先写 spec 再让 AI 实现是什么流程?
- Q7-04AI 生成的代码你怎么审查?哪些坑是 AI 代码高发的?
- Q7-06团队有人 vibe coding 上瘾、代码没人看得懂,你怎么立规矩?
- Q8-02设计企业内部知识库助手:不同部门的权限隔离怎么做?
- Q8-03设计一个工单自动处理 Agent:分类、查询、升级转人工
- Q8-04设计一个合同审查助手:长文档、条款比对、风险标注
- Q8-05设计客服机器人:怎么做到「不知道就说不知道」?
- Q8-08设计给老板的「用嘴查数」系统(NL2SQL),准确率不够怎么兜底?