评测集建设

评测与可观测入门13讲解 5

评测集分三层:冒烟的黄金集、覆盖分层的回归集、从线上回流的 badcase 集。来源按含金量排序是真实日志、badcase、人工构造、合成;防泄漏三条要在标注前就守住。规模的三套数字对应三个阶段 —— 几十条起步、几百条回归、上千条做统计。

也叫:评测集 · 黄金集 · golden set · 回归集 · 样本量 · 数据泄漏

二、评测集的三层结构出自 T5-1

不是一个评测集,是三个,跑的频率和拦截权限都不同:

规模 跑的时机 耗时 拦不拦发布
冒烟集 smoke 5–20 条 每次提交 秒级 拦(挂了说明链路断了)
门禁集 gate 几十 ~ 两百条 每次发布 分钟级
全量集 full 几百 ~ 上千条,含长尾 每周 / 大改动 小时级 不拦,只报告

判据:能进门禁集的,必须是「错了就该拦住发布」的用例。 把「锦上添花」的题放进门禁,结果一定是门禁天天红、所有人学会无视它——一个从不亮绿灯的门禁等于没有门禁。

以上节选自T5-1 评测集建设与离线/在线的鸿沟,读全文能看到前后语境。

三、评测集从哪来(四个来源,按含金量排序)出自 T5-1

  1. 线上真实失败(最贵、最值钱)。每一条都是花了真实代价换来的。
  2. 线上真实成功流量的分层抽样。它保证的不是难度,是分布——开篇故障缺的就是这一类。
  3. 领域专家写的边界样例。覆盖罕见但后果严重的情况:越权、敏感、法规、极端数值。
  4. 模型批量扩写。最便宜。

铁律:第 4 类只能用来扩写,不能用来打底。 用模型生成的题去测模型,你测到的是「两个模型共同认为重要的部分」。真正会翻车的地方,恰恰是两个模型有共同盲区的地方——而合成数据在那里是空白的。所以听到「我们评测集有 5000 条」,第一句该问的是「谁标的」。

以上节选自T5-1 评测集建设与离线/在线的鸿沟,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到12