主观任务与人工评测设计
文案、对话质量这类主观任务,最差的判据是一个 1–5 的总体质量分:标注者之间对不齐, judge 也学不会。可靠的做法是拆成可判的维度、用成对比较代替打分、盲评、写标注指南并量标注者一致性;校准集要多少条,由它替你做多大的决策决定。
也叫:主观评测 · 人工评测 · 人工标注 · 成对比较 · pairwise · 标注者一致性 · 盲评 · 标注指南
先学评测集建设
五、判据形态:最差的是「一个 1–5 的总体质量分」出自 T5-2
这里有一处真实的分歧,值得如实写出来:
- Anthropic 官方指引倾向:judge 输出离散值(correct/incorrect 或 1–5),判据具体到可证伪(「答案必须在第一句提到 Acme Inc.,否则直接判错」),并先推理再打分、然后丢掉推理。
- 实践派主流主张:只用二元 pass/fail。理由是相邻刻度差异高度主观,3 分和 4 分的边界连人类标注者之间都对不齐,κ 自然上不去。
这两条的分歧点其实是「这个分数要去做什么决策」:
要做门禁(二元决策:发 / 不发)
→ 用二元判据。把复杂性放进「多个二元维度」,不是「一个连续分数」
是否有据(0/1)|是否覆盖必答要点(0/1)|是否越界(0/1)
综合质量 3.7 分
要做排序(挑最优、选型)
→ 才需要有序刻度;而且此时应该用 pairwise,不是 pointwise 打分最差的形态是「一个 1–5 的总体质量分」:既做不了门禁(3.6 和 3.8 差在哪没人说得清),又不可比(judge 一换版本整体漂移)。它唯一的作用是让看板上有个数字在动。
以上节选自T5-2 LLM-as-Judge:偏差、校准与适用边界,读全文能看到前后语境。