评测集建设
评测集分三层:冒烟的黄金集、覆盖分层的回归集、从线上回流的 badcase 集。来源按含金量排序是真实日志、badcase、人工构造、合成;防泄漏三条要在标注前就守住。规模的三套数字对应三个阶段 —— 几十条起步、几百条回归、上千条做统计。
也叫:评测集 · 黄金集 · golden set · 回归集 · 样本量 · 数据泄漏
二、评测集的三层结构出自 T5-1
不是一个评测集,是三个,跑的频率和拦截权限都不同:
| 层 | 规模 | 跑的时机 | 耗时 | 拦不拦发布 |
|---|---|---|---|---|
| 冒烟集 smoke | 5–20 条 | 每次提交 | 秒级 | 拦(挂了说明链路断了) |
| 门禁集 gate | 几十 ~ 两百条 | 每次发布 | 分钟级 | 拦 |
| 全量集 full | 几百 ~ 上千条,含长尾 | 每周 / 大改动 | 小时级 | 不拦,只报告 |
判据:能进门禁集的,必须是「错了就该拦住发布」的用例。 把「锦上添花」的题放进门禁,结果一定是门禁天天红、所有人学会无视它——一个从不亮绿灯的门禁等于没有门禁。
以上节选自T5-1 评测集建设与离线/在线的鸿沟,读全文能看到前后语境。
三、评测集从哪来(四个来源,按含金量排序)出自 T5-1
- 线上真实失败(最贵、最值钱)。每一条都是花了真实代价换来的。
- 线上真实成功流量的分层抽样。它保证的不是难度,是分布——开篇故障缺的就是这一类。
- 领域专家写的边界样例。覆盖罕见但后果严重的情况:越权、敏感、法规、极端数值。
- 模型批量扩写。最便宜。
铁律:第 4 类只能用来扩写,不能用来打底。 用模型生成的题去测模型,你测到的是「两个模型共同认为重要的部分」。真正会翻车的地方,恰恰是两个模型有共同盲区的地方——而合成数据在那里是空白的。所以听到「我们评测集有 5000 条」,第一句该问的是「谁标的」。
以上节选自T5-1 评测集建设与离线/在线的鸿沟,读全文能看到前后语境。
延伸阅读
考这个知识点的题1 道
会连带问到12 道
- Q2-15RAG 的召回率怎么评估?测试集从哪来?
- Q3-14跨会话记忆怎么做?记忆检索和 RAG 是一回事吗?
- Q3-21Agent 怎么评测?只看最终结果不看轨迹会漏掉什么?
- Q4-09微调数据从哪来?怎么保证质量?多少条够?
- Q4-12你简历里那次微调,效果提升怎么量化的?和 few-shot 基线比过吗?
- Q5-02离线评测分很高,上线效果差——可能出了什么问题?
- Q5-04主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?
- Q5-05Agent 的轨迹评估和单轮问答评估有什么不同?
- Q5-08换了新模型 / 新 prompt,怎么科学地做回归测试和 A/B?
- Q5-09用户点赞点踩怎么用起来,形成数据飞轮?
- Q7-03复杂任务怎么拆给 AI?先写 spec 再让 AI 实现是什么流程?
- Q7-04AI 生成的代码你怎么审查?哪些坑是 AI 代码高发的?