LLM-as-Judge 是什么?它自己有哪些偏差?怎么校准?

Q5-03评测与可观测高频LLM-as-Judge位置偏差自我偏好冗长偏差校准Cohen kapparubric

谁在问:头部 AI 公司二面;做过评测体系的团队必问

口语化问法

  • 你们主观指标怎么评的?用大模型判分吗?它准吗?
  • LLM-as-Judge 有哪些已知问题?位置偏差你了解吗?
  • 你怎么知道你的 judge 判得对?

考察意图

这是 2026 年新升为高频的一道题,因为「用大模型判分」已经是默认做法,区分度就从「知不知道」转移到了「有没有校准过」。面试官在判断:

  1. 你把 judge 当尺子还是当分类器。 当尺子的人说「它挺准的」;当分类器的人说「它的 κ 是 0.81,最低的那条判据是 0.63」。
  2. 你能不能说出偏差的量级。 说得出名词的人很多,说得出「位置偏差大约会让 1/5 的判断翻转」的人很少。
  3. 你知不知道 judge 的边界。 最后这一刀最狠:什么场景绝对不能用 judge。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

LLM-as-Judge 就是用一个大模型去给另一个模型的输出打分,一般用在主观指标上,比如文案质量、回答是否有帮助。它已知的问题有位置偏差——成对比较时偏好排在前面的那个;有自我偏好——偏袒和自己同源的输出;还有冗长偏差,长答案容易得高分。缓解办法主要是把顺序对调各评一次取平均,用不同厂商的模型做 judge,以及把评分标准写清楚。校准的话,就是标一批人工数据看看 judge 和人一致不一致。

这个答案能过,因为名词、方向、缓解手段都对。

它止步于 60 分的原因很具体:全是形容词,没有一个数字,也没有一个流程。 「一致不一致」用什么指标衡量?多少条才够?κ 到多少能上线?一追就空。而且它没有触及最关键的边界问题。

90

90 分答案(有生产经验的回答)

我分三层说:它是什么、它错在哪且多严重、我怎么让它变得可信。

一、它是一个分类器,不是一把尺子。 judge 输出的不是真相,是一个模型对某条判据的预测。既然是预测,它就有准确率、有偏差、有漂移、有版本。所以我们内部的规矩是:任何 judge 上线前必须有三样东西——人工标注的校准集、一个一致性指标、一个钉死的版本号。缺一样,它的分数不能进决策。 形态上分三种,用途不同:pointwise 单条打分(适合门禁和线上监控,毛病是跨版本漂移)、pairwise 成对比较(适合选型和 A/B,毛病是位置偏差且成本翻倍)、reference-based 对参考答案判(适合有标注的回归)。

二、偏差是有量表的,不是「听说有」。 公开的偏差基准(CALM)给过一组鲁棒率,1.0 表示完全不受影响。以当时最强的 judge 为例:位置约 0.82,也就是大约 1/5 的判断会随呈现顺序改变;冗长 0.92 左右,其实相对可控;但从众只有 0.64、情感只有 0.65——你在判据里写一句「大多数用户更喜欢简洁风格」,就足以把结果带偏;一个语气笃定但内容错误的答案,也比语气谨慎但正确的答案更容易赢。 我们自己真踩过一次位置偏差:改版 prompt 的 pairwise 评测新版胜率 68%,上线后点击率掉了 9%。复盘时把 A/B 顺序对调重跑,胜率变成 41%——它评的很大一部分是「谁排在前面」。而且新版比旧版平均长 40%,冗长偏差和位置偏差同向叠加。 关于自我偏好,要诚实地说:不同研究测出的量级差异很大,有的测法下只有 1–2% 的错误率,有的测法下很显著,方向一致但量级取决于怎么测。所以正确态度不是背数字,是用自己的标注集测自己的 judge

三、缓解和校准,以及各自的代价。 位置偏差的标准解法是 swap-and-average——正反各评一次。但要说清它的机制:它不消除偏差,它把偏差暴露成平局。 代价是成本翻倍,还会产生一批不一致对。而这批不一致对恰恰是最有价值的东西:judge 在哪些样本上摇摆,就说明判据在哪里没写清楚。 我们有一次把不一致对捞出来人工看,发现是判据里「简洁」和「覆盖全面」两条互相打架,judge 在冲突时随机倒向一边,而顺序决定了它先看到谁。 校准是五步:分层抽样 → 人工按每条判据独立标注(二元优先)→ 跑 judge → 算 κ(整体和逐判据)+ TPR/TNR → 针对最低的那条判据改写或拆分,回到第三步。经验上要改 2–4 轮才能把 κ 顶到 0.8。 有一步最容易被跳过也最救命:先测两个人之间的一致率。人和人对同一条判据都只有 0.45,那不是 judge 的问题,是判据本身没定义清楚,怎么调 judge prompt 都白费。

四、最后是边界,这条比所有偏差都重要:judge 只在「有参照物」时可靠。忠实度(答案有没有超出给定来源)——参照物就在 prompt 里,本质是文本蕴含判断,可用;判客观正确性(这件事是不是真的)——没有参照物,judge 得自己「知道」,这等于把幻觉问题转嫁给另一个会幻觉的模型,两个模型共同不知道的事它会自信地判正确。客观正确性只有两条合法路径:事先标好的金标准,或者可执行的验证。 还有一条:能用代码判的坚决不用 judge——JSON 合法性、数值区间、有没有调过某个工具、是否命中关键词,这些用代码判又快又准又免费。


追问链

图 1 · 五层追问树:面试官会往哪儿挖
把「挺准的」逼成一个可验收的数:κ、鲁棒率、采样率

  1. 位置偏差你具体怎么测出来的?缓解的代价是什么?

    期望测法五分钟就能做完:同一批样本 A/B 顺序对调重跑,统计结论不一致的比例;指标是互换一致率与首位胜率(0.5 为中性)。代价说全:成本翻倍、产生一批要人工或第二 judge 裁决的平局,而且 swap-and-average 不消除偏差,只把它暴露成平局
    信号说「换个更强的模型当 judge 就好」→ 把校准问题当模型问题;说「不一致的那批是判据的诊断样本」→ 真捞出来看过
  2. 校准集要多少条?看什么指标算合格?

    期望规模由这个 judge 替你做多大的决策决定:看趋势每判据 20–30 条、κ ≥ 0.6;当 CI 门禁 100 条起、κ ≥ 0.8 且必须同报 TPR/TNR。阈值:< 0.40 是判据有问题、重写 rubric0.61–0.79 上线加监控;≥ 0.80 才进 CI
    信号只说「标个几十条看看准不准」→ 没有指标就没有验收线;只看 accuracy 不看 TPR/TNR → 类别不平衡时会被严重误导
  3. judge 和人的一致率只有 0.5,你怎么办?

    期望第一反应怀疑判据、不怀疑 judgeκ < 0.4 的处置是重写 rubric先测人和人的一致率:人也只有 0.5 → 判据没定义清楚,拆细成二元维度、补正反例;人有 0.85 而 judge 只有 0.5 → 才轮到 judge 侧:加示例、先理由后结论、拆成多次独立调用
    信号直接调 judge 的 prompt 或「换个更贵的模型」→ 方向反了,最常见的错误;「人都对不齐的判据 judge 学不会」→ 几乎可判定真做过校准
  4. judge 的分数能不能当线上监控指标,甚至团队 KPI?

    期望监控可以,但只看趋势和分布、不看绝对值 —— 线上输入分布每天在变,分数掉了要先问「是系统变差还是问题变难」。当 KPI 绝对不行:考核一挂上,团队就对着 judge 优化,等于主动往偏差方向走。工程上判分必须采样(基线 2%,高风险路由提到 20%)、必须异步不在关键路径
    信号说「可以,我们就是这么做的」却不提采样和异步 → 没上过线,同步判分把 P99 直接翻倍;提「换 judge 要重跑历史基线」→ 被这件事坑过
  5. judge 成本已超过被评系统本身:换小模型做 judge,还是把采样率从 20% 降到 2%?

    期望默认先降采样率:它只损失统计精度,置信区间变宽可以靠延长统计窗口换回来(原来看小时改看天),可逆、连续可调、不影响历史可比 → 换 judge 模型是不连续变更,要重走完整校准,换完历史分数全部作废。反转条件:判的若是格式合规、有没有引用编号这类客观可枚举维度,根本不该换小模型,直接改代码判分 → 第三条路是分层判分,代码先过滤,剩下的才送 judge
    信号直接选「换小模型」不提重新校准 → 没把 judge 当需要验收的组件;反问「这个 judge 在判什么维度」并把一部分改成代码判分 → 跳出二选一
只会背「位置偏差、自我偏好」两个名词的,第 1 层就见底 —— 它问的是怎么测、代价是什么。真分水岭在第 3 层:一致率低,你先改判据还是先调 judge。

评分要点

  1. 定位正确:judge 是分类器,不是尺子;上线三件套(校准集 / 一致性指标 / 版本号)
  2. 说得出三种形态(pointwise / pairwise / reference-based)及各自主要毛病
  3. 偏差给量级不给形容词:位置约 1/5 翻转;从众与情感的鲁棒率更低;冗长相对可控
  4. 知道 swap-and-average 不消除偏差、只暴露成平局,并知道不一致对是判据诊断样本
  5. 校准五步完整,且校准集规模由决策权重决定;κ 阈值说得出(0.4 / 0.6 / 0.8)
  6. 知道先测人和人的一致率
  7. 边界:judge 只在有参照物时可靠;判客观正确性不可用;能代码判的不用 judge
  8. 工程化:线上采样 + 异步;judge 版本号;换 judge 要重跑历史基线;不能当 KPI

常见错误

「judge 有位置偏差和自我偏好」只有名词,说不出量级,也说不出怎么测。这是本题最典型的「读过一篇博客」
「我们用大模型打分,挺准的」「准」没有对照物。追一句「和什么比准」就崩
「让它打 1–5 分取平均」形态错误:既做不了门禁(3.6 和 3.8 差在哪说不清),又不可比
「换个更强/不同厂商的模型当 judge 就行」把校准问题当模型问题。换家族是止痛药,测量才是解药
判客观正确性也用 judge把幻觉问题转嫁给另一个会幻觉的模型,且完全没意识到
用 judge 判 JSON 合不合法、有没有调某工具该用代码判的用了模型判,又慢又贵又不准
校准只说「标一批数据看看」没有指标、没有规模、没有验收线
完全不提 judge 的版本管理一旦换 judge,所有历史曲线作废而不自知

关联学习