LLM-as-Judge 的偏差与校准
judge 是一个分类器,要用分类器的标准验收:偏差谱系有量表 —— 位置偏差消不掉只能对冲、自我偏好、冗长偏差。它只在有参照物(参考答案或成对比较)时可靠;校准流程五步,用 Cohen κ 对人工标注验收,judge 本身要版本管理。
也叫:LLM-as-Judge · judge · 位置偏差 · 自我偏好 · 冗长偏差 · 校准 · Cohen kappa · κ
先学评测集建设
二、偏差谱系:不是「听说有」,是有量表的出自 T5-2
CALM 基准(Justice or Prejudice,arXiv 2410.02736)对 12 类偏差给出了鲁棒率(1.0 = 完全不受影响)。以当时最强的两个 judge 为例:
| 偏差类型 | 人话 | GPT-4-Turbo | GPT-4o |
|---|---|---|---|
| 位置 | 换个前后顺序结论就变 | 0.818 | 0.776 |
| 从众 bandwagon | 告诉它「80% 的人选 A」 | 0.638 | 0.791 |
| 情感 sentiment | 语气自信/讨好的答案占便宜 | 0.653 | 0.699 |
| 权威 authority | 编一个不存在的引用就能抬分 | 0.729 | 0.790 |
| 干扰 distraction | 塞进无关信息就改判 | 0.846 | 0.787 |
| 冗长 | 长答案占便宜 | 0.915 | 0.977 |
| 自我增强 | 偏袒自己(该测法下按错误率计) | 1.16% | 1.74% |
三条人话结论:
- 位置偏差量级最实在:约 1/5 的判断会随顺序改变。开篇的 68% → 41% 不是极端案例,是这个量级的自然后果。
- 从众和情感的鲁棒率只有 0.65 左右,比位置偏差更糟。意味着判据里千万不能出现「大多数用户偏好 A 风格」这类引导语,也意味着语气笃定但内容错误的答案,比语气谨慎但正确的答案更容易赢。
- 冗长偏差反而相对可控——判据里写一句「简洁不加分也不减分,只看是否覆盖要点」就掉得很快。真正难治的是那些你没写进判据的维度。
关于自我偏好,另有一份 2026-04 的专项研究(arXiv 2604.22891)用「等质量对」构造法,在 20 个主流模型 × 100 题上把 judge 分成四类:客观型 / 马基雅维利型(有能力分辨却系统性偏袒自己)/ 无能随机型 / 反向偏见型。关键工程结论是:把「整体打一个分」换成按维度的成对强制选择,在高偏差模型上平均降低自我偏好 31.5%,不需要重训。
注意这两份研究的量级并不一致(CALM 测出自我增强错误率只有 1–2%,专项研究测出显著偏差)。方向一致、量级取决于测法。 所以正确态度不是背数字,是用你自己的标注集测你自己的 judge。
以上节选自T5-2 LLM-as-Judge:偏差、校准与适用边界,读全文能看到前后语境。
延伸阅读
T5-2 · 背景
一、第一件要接受的事:judge 是一个分类器
LLM-as-Judge:偏差、校准与适用边界
T5-2 · 背景
三、位置偏差为什么「消不掉」
LLM-as-Judge:偏差、校准与适用边界
T5-2 · 背景
四、【本篇最关键】judge 只在「有参照物」时可靠
LLM-as-Judge:偏差、校准与适用边界
T5-2 · 背景
六、校准流程(五步,可直接背)
LLM-as-Judge:偏差、校准与适用边界
T5-2 · 旁支
κ 的验收阈值(沿用 Landis & Koch 传统,AWS 示例仓采用同一套)
LLM-as-Judge:偏差、校准与适用边界
T5-2 · 旁支
judge 的版本管理(最容易漏、后果最大)
LLM-as-Judge:偏差、校准与适用边界