离线 / 在线鸿沟
离线分很高、上线效果差,来源有四个:评测集与线上分布脱节、数据泄漏、上下文不一样(离线没有真实的对话历史与工具结果)、指标本身不代表用户要的东西。三条线 —— 能不能发、发完有没有变坏、变坏了怪谁 —— 是本章主线。
也叫:离线在线鸿沟 · 分布脱节 · 三条线 · 离线评测 · 线上效果
先学评测集建设
一、离线/在线鸿沟的四个来源出自 T5-1
离线 92 分
│
┌───────────────┼───────────────┬───────────────┐
▼ ▼ ▼ ▼
① 输入分布不同 ② 判据不同 ③ 上下文不同 ④ 数据泄漏
问法/长度/轮次 要点命中 vs 单轮干净输入 vs 评测集与开发集
/比例/难度 解决了问题 历史+状态+工具 同源,prompt
结果堆叠 对着它调出来的
│ │ │ │
▼ ▼ ▼ ▼
线上 2.3 倍投诉① 输入分布不同 —— 最常见,也最容易被忽略,因为它不报错。检查方法很朴素:把评测集和线上采样的 query 各自统计长度分布、轮次分布、意图分布,摆在一张表里看(开篇那张表就是这么来的)。一个下午能做完,但绝大多数团队从来没做过。
② 判据不同 —— 离线判「要点命中」,用户判「有没有帮我把事办了」。要点全命中但结论埋在第三段,离线满分线上被骂。而且这个偏差会随着你对着判据优化而不断放大。
③ 上下文不同 —— 承接四种上下文失败形态(污染 / 干扰 / 混淆 / 冲突)。离线是一次干净的单轮调用;线上是第 7 轮,前面堆了 3 次工具返回、1 次压缩、和一条用户中途改主意的指令。只测第一轮的评测集,一种都测不出来。
④ 数据泄漏 —— 最隐蔽。典型形态是评测集和调 prompt 用的例子同源,或者更常见的,prompt 是对着评测集一轮轮调出来的。此时分数上涨里有多少是真提升,你分不清。
以上节选自T5-1 评测集建设与离线/在线的鸿沟,读全文能看到前后语境。
延伸阅读
考这个知识点的题1 道
会连带问到11 道
- Q2-17用户说「答非所问」,你怎么归因是检索问题还是生成问题?
- Q3-21Agent 怎么评测?只看最终结果不看轨迹会漏掉什么?
- Q4-11微调后"学会了新任务但变笨了"怎么办?
- Q5-01AI 应用上线前怎么评测?评测集怎么建、多少条起步?
- Q5-04主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?
- Q5-05Agent 的轨迹评估和单轮问答评估有什么不同?
- Q5-06一次多轮 Agent 请求的 trace 里应该记哪些东西?
- Q5-07线上怎么发现质量回退?没有标准答案的场景怎么定监控指标?
- Q5-08换了新模型 / 新 prompt,怎么科学地做回归测试和 A/B?
- Q5-10印象最深的一次线上质量事故,怎么定位和修的?
- Q8-08设计给老板的「用嘴查数」系统(NL2SQL),准确率不够怎么兜底?