数据飞轮与用户反馈

评测与可观测进阶8讲解 1

点赞点踩是稀疏且有偏的显式信号,隐式信号(重问、复制、放弃)更多但更难解释;用采样器把它们变成待标注队列,错误分析回流成评测集与训练数据,让每次失败都留下资产。指标会反噬 —— 优化点赞率不等于优化质量。

也叫:数据飞轮 · 用户反馈 · 隐式信号 · 错误分析 · 采样器 · 指标反噬

五、数据飞轮:让每次失败都留下资产出自 T5-3

原文示意
线上 trace
   │
   ├─ 采样 + 用户信号(点踩、转人工、重问)挑出候选失败
   │
   ├─ 错误分析:开放编码(每条失败写一句话)→ 轴心编码(归并成 5–10 个失败类别)
   │
   ├─ 每个新失败模式补 1 条评测用例(最小可复现输入,不是整条 trace)
   │
   └─ 评测集增长 → 门禁变严 → 同类问题不再复发

关于点赞点踩,有三件事必须讲清楚,否则这条飞轮转不起来:

  1. 点踩率是趋势信号,不是标注。 反馈率通常只有个位数百分比,且重度偏向不满的用户——直接拿它当质量指标会系统性偏低。它的正确用法是当采样器:把点踩样本优先送进人工复核队列。
  2. 点踩必须能定位到 trace。 反馈事件要带 trace_id 和 conversation_id 落库,否则你只知道「有人不满意」,不知道他不满意什么。这是产品和工程最常见的接口漏配。
  3. 点赞几乎没有信息量,点踩才有。 更值钱的是隐式负反馈:立刻重问、改写问题再问一次、中途放弃、转人工——这些不需要用户动手,覆盖率高一个数量级。

两条可背判据: ① 每一次线上事故都必须以「评测集里新增了一条用例」结束。 只回滚、只改 prompt、不补用例的,这个问题一定会换个形式回来。 ② 评测集不是只增不减。 定期把「最近所有版本都 100% 通过」的用例降级到冒烟集——它们已经失去区分度,只在消耗预算。


以上节选自T5-3 可观测:trace、线上质量监控与数据飞轮,读全文能看到前后语境。

考这个知识点的题1

会连带问到7