离线 / 在线鸿沟

评测与可观测进阶12讲解 3

离线分很高、上线效果差,来源有四个:评测集与线上分布脱节、数据泄漏、上下文不一样(离线没有真实的对话历史与工具结果)、指标本身不代表用户要的东西。三条线 —— 能不能发、发完有没有变坏、变坏了怪谁 —— 是本章主线。

也叫:离线在线鸿沟 · 分布脱节 · 三条线 · 离线评测 · 线上效果

一、离线/在线鸿沟的四个来源出自 T5-1

原文示意
                    离线 92 分
                        │
        ┌───────────────┼───────────────┬───────────────┐
        ▼               ▼               ▼               ▼
   ① 输入分布不同   ② 判据不同      ③ 上下文不同     ④ 数据泄漏
   问法/长度/轮次   要点命中 vs      单轮干净输入 vs  评测集与开发集
   /比例/难度       解决了问题       历史+状态+工具    同源,prompt
                                     结果堆叠          对着它调出来的
        │               │               │               │
        ▼               ▼               ▼               ▼
      线上 2.3 倍投诉

① 输入分布不同 —— 最常见,也最容易被忽略,因为它不报错。检查方法很朴素:把评测集和线上采样的 query 各自统计长度分布、轮次分布、意图分布,摆在一张表里看(开篇那张表就是这么来的)。一个下午能做完,但绝大多数团队从来没做过。

② 判据不同 —— 离线判「要点命中」,用户判「有没有帮我把事办了」。要点全命中但结论埋在第三段,离线满分线上被骂。而且这个偏差会随着你对着判据优化而不断放大。

③ 上下文不同 —— 承接四种上下文失败形态(污染 / 干扰 / 混淆 / 冲突)。离线是一次干净的单轮调用;线上是第 7 轮,前面堆了 3 次工具返回、1 次压缩、和一条用户中途改主意的指令。只测第一轮的评测集,一种都测不出来。

④ 数据泄漏 —— 最隐蔽。典型形态是评测集和调 prompt 用的例子同源,或者更常见的,prompt 是对着评测集一轮轮调出来的。此时分数上涨里有多少是真提升,你分不清。

以上节选自T5-1 评测集建设与离线/在线的鸿沟,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到11