Agent 评测:看轨迹而不只看结果
Agent 会以「看起来成功」的方式失败:结果对了但绕了十二步、调了不该调的工具、状态改错了。四个评测层次里轨迹评估是核心,指标要看分布而不是均值,不可复现是常态所以要多跑几次;评测集会过拟合,要持续从线上 badcase 补。
也叫:Agent 评测 · 轨迹评估 · trajectory eval · 分布指标 · 状态检查
再学人机协同与转人工
只看结果会漏掉什么(Q3-21 的核心答案)出自 T3-11
| 漏掉的问题 | 表现 | 只有轨迹能看到的证据 |
|---|---|---|
| 路径低效 | 结果对,成本 4 倍 | 步数分布、重复动作 |
| 工具误用侥幸正确 | 结果对,隐患埋下 | 调用了哪张表 / 哪个工具 |
| 护栏绕过 | 结果对,权限失效 | 被拒绝后的重试路径 |
| 压缩漂移 | 结果格式对,内容错 | 压缩事件前后的约束变化 |
| 子 Agent 谎报 | 编排器认为成功 | worker 的实际工具调用记录 |
| 不可靠 | 这次对,下次不对 | 多次重复运行的一致性 |
| 幻觉参数 | 侥幸没报错 | 模型生成的参数 vs 受信来源 |
最后一行的可靠性值得单独说:单次通过率和重复一致性可以差得非常远——业内已有观察指出,单次通过率约六成的 Agent,在多次重复同一任务时全部成功的比例可能只有二成多。所以"我们成功率 85%"这句话在 Agent 语境下是有歧义的:是跑一次的 85%,还是跑五次都对的 85%? 面试里主动区分这两者,是很强的信号。
工程上的做法是引入 pass^k(跑 k 次全对的比例) 这类指标,与 pass@1 并列汇报。对高风险场景,pass^k 才是有意义的那个数。
以上节选自T3-11 Agent 评测与 trace——它们会以"看起来成功"的方式失败,读全文能看到前后语境。
延伸阅读
考这个知识点的题2 道
会连带问到22 道
- Q1-07推理模型(thinking 类)和普通模型有什么区别?什么任务值得用?
- Q1-12什么是 context rot?为什么上下文越长模型反而变笨?
- Q1-13多轮历史越来越长你怎么压缩?compaction 时什么必须保真?
- Q3-02什么时候该用 workflow,什么时候该上 Agent?盲目上 Agent 会踩什么坑?
- Q3-06手写一个最小 ReAct 循环:退出条件和死循环兜底怎么设计?
- Q3-07ReAct、Plan-and-Execute、Reflection 三种范式的区别与选型?
- Q3-12Agent 的记忆系统怎么设计?短期、长期记忆分别放哪?
- Q3-14跨会话记忆怎么做?记忆检索和 RAG 是一回事吗?
- Q3-15多 Agent 有哪些编排模式?orchestrator-workers 适合什么场景?
- Q3-16多 Agent 一定比单 Agent 好吗?什么时候反而是灾难?
- Q3-17LangGraph / OpenAI Agents SDK / ADK / CrewAI 怎么选?为什么不少团队最后自己写循环?
- Q3-18Agent 跑偏或幻觉了怎么办?护栏在架构里放哪几层?
- Q3-19什么是分级自治?高危操作(写库 / 发邮件 / 付款)怎么设计人工确认?
- Q3-20什么是 Harness 治理?为什么说 Agent 的能力一半在模型一半在 harness?
- Q3-22Agent 的 trace 怎么做?出了问题怎么定位是哪一步错的?
- Q3-25从零设计一个能查库存、能下单的电商客服 Agent,讲讲整体架构
- Q5-01AI 应用上线前怎么评测?评测集怎么建、多少条起步?
- Q5-06一次多轮 Agent 请求的 trace 里应该记哪些东西?
- Q5-10印象最深的一次线上质量事故,怎么定位和修的?
- Q6-05实时语音链路怎么搭?级联 ASR→LLM→TTS 和端到端语音模型的取舍?
- Q6-09应用 token 成本突然涨了 3 倍,怎么排查和治理?
- Q8-03设计一个工单自动处理 Agent:分类、查询、升级转人工