主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?

Q5-04评测与可观测常见主观评测人工标注成对比较标注者一致性盲评标注指南

谁在问:产品向团队;内容/对话类业务的二面

口语化问法

  • 文案好不好这种东西没法量化吧?你们怎么评的?
  • 你们做人工评测吗?怎么组织的、几个人标、怎么保证标得准?
  • 对话质量这种主观指标,你怎么向老板证明新版更好?

考察意图

这道题表面问「主观任务」,实际在测三件事:

  1. 你会不会把「主观」当成放弃量化的借口。 好的回答第一步一定是拆维度——拆完你会发现大部分所谓主观维度其实是客观的。
  2. 你懂不懂人也是有偏差的评判者。 位置偏差、疲劳、锚定、品牌预期,人一样有。不做盲评和随机化的人工评测,结论未必比 judge 可信。
  3. 你知不知道人工评测的产出是什么。 新手以为产出是「一个分数」,做过的人知道产出是判据和校准集——它的终点是让 judge 能接手。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

主观任务我们会做人工评测。找几个人对新旧两版打分,比如 1–5 分,然后取平均看哪版高。为了避免主观,我们会写一个评分标准,说明什么样算 5 分、什么样算 3 分。样本量大概几十条,每条至少两个人标,不一致的再讨论。最后如果新版平均分明显高,就上线。

方向都对:有标准、有多人、有分歧处理。所以能过。

它止步于 60 分的原因是——没有盲评、没有随机化、没有一致性指标、没有显著性,而且默认了「1–5 分取平均」这个最容易出问题的形态。「明显高」是多少?0.2 分算不算?

90

90 分答案(有生产经验的回答)

我分四步:先拆维度,再选形态,再设计流程,最后说这件事的真正产出。

一、先拆维度——「主观」这个词往往是没拆导致的。 「文案好不好」拆开之后,通常是这样一个漏斗:

  • 能用代码判的(占比比想象中大):字数区间、是否含必要要素(品牌名、价格、行动号召)、是否含禁用词与违规表述、结构是否符合模板、有没有编造数字。这一层直接写断言,零成本零噪声。
  • 能对着参照物判的:是否忠于素材(不超出给定的产品信息)、是否覆盖了 brief 里点名的卖点。有参照物,可以交给 judge。
  • 真正只能人判的:语感、调性是否符合品牌、有没有「广告味」、笑点会不会尬。通常只剩一两条。

关键判断:先把前两层榨干,再动用人。 人工评测是整个体系里最贵的资源,用在能代码判的地方是纯粹浪费。

二、形态上,成对比较优于绝对打分。 人对「这两个哪个更好」的判断稳定,对「这个几分」的判断极不稳定——同一个人隔一周打分能差 0.5,而且会随着看过的样本漂移(前面看了一批烂的,后面的都显得好)。所以我们的默认形态是盲态成对比较:两版并排、隐藏来源、随机左右顺序。 需要绝对分数的场合(比如要报一个「合格率」),也不打 1–5,而是拆成多个二元判据:调性符合(是/否)、有无广告味(是/否)、是否可直接发布(是/否)。二元判据的标注一致率远高于刻度打分。

三、流程上有五条是必须的:

  1. 盲评 + 随机化——人也有位置偏差和品牌预期偏差,「这是我们新版」一说出口,结论就废了。
  2. 先跑一轮对齐(pilot):20–30 条,两三个人独立标,算标注者间一致率人和人都对不齐的判据,不是判据,是意见。 这一轮的产出是改判据,不是出结论。
  3. 每条至少两人标,分歧的第三人裁决,并且把分歧样本单独留档——它们是判据最需要修的地方。
  4. 混入黄金题(已知答案的样本,占 5%–10%)监测标注质量,防止疲劳期乱标。
  5. 控制批量与疲劳:单人单次不超过一小时/几十条;分层抽样而不是只标典型样本。

四、这件事的真正产出,不是分数,是判据和校准集。 人工评测太贵,不可能每次改动都跑。它的正确定位是:用人工标注出一批高质量样本,去校准一个 judge,然后让 judge 承担日常回归,人只在校准和抽检时出场。 所以我们对一次人工评测的验收标准是两条——判据被改到人和人能对齐;产出的标注集能把 judge 的一致性顶到可用线。

最后,出结论时要过统计关:小样本上 5% 的差距很可能是噪声,成对比较要按结论翻转的样本算显著性,而不是比平均分。


追问链

图 1 · 五层追问树:面试官会往哪儿挖
「主观」多半是没拆导致的:五层逼你把形容词落成可标的判据

  1. 「调性符合品牌」这种维度,怎么写成能标的判据?

    期望判据要写成可证伪的形式,不能写成形容词:「专业」不可标,「不使用网络流行语」「不使用第二人称祈使句」「术语用行业标准称谓」可标。正反例是判据的一部分,反例比正例重要 —— 反例才划得出边界;实在写不出就降级成成对比较,比强行发明一个刻度可靠
    信号只说「写清楚评分标准」→ 没写过;给得出「把形容词换成可观察行为」的具体例子,或提判据版本号 → 做过
  2. 为什么不用 1–5 分?平均分不是更方便看趋势吗?

    期望刻度打分三个毛病:相邻刻度边界主观(3 和 4 差在哪两个人对不齐)、随批次漂移、平均分掩盖分布(一批 3 分和「一半 5 分一半 1 分」均值相同,产品含义完全相反)。替代是二元判据 × 多维度,或成对比较;非要一个数就用合格率,有产品含义且能直接当门禁
    信号说不出「平均分掩盖分布」→ 没被这件事坑过;主动说「看分布不看均值,尤其看最差那一档的比例」→ 做过内容质量
  3. 两个标注者一直对不齐怎么办?

    期望第一反应是改判据,不是换人、不是投票取多数:捞出分歧样本逐条看,通常是两条标准在打架或某个词有歧义 → 三选一处理(拆成两条 / 补正反例 / 判定不可标、降级为参考指标)。硬判据是人对不齐的维度永远不进发布门禁,也别指望 judge 学得会
    信号说「投票取多数」或「换个更专业的标注者」→ 把最有价值的分歧信息丢了;能认出「有些分歧是需求没对齐,不是标注问题」→ 很成熟
  4. 人工评测多久做一次?多少条?成本怎么控?

    期望不是定期做,是按触发做:判据变了、模型或 prompt 大改、judge 一致率掉了、新增渠道。规模按用途:校准 judge 每判据 20–30 条起,做门禁的 judge 要 100 条起,抽检每周十几条。控成本靠分工:人管校准与抽检、judge 管日常回归、代码管所有硬约束
    信号说「每次发版都全量人工评」→ 不可持续,也说明 judge 体系没建;说「人工评测的量应该随时间下降」→ 很强的信号
  5. 产品经理说他自己看了 20 条,感觉新版明显更好,让你直接发,你怎么办?

    期望不否定他,先指出这 20 条为什么不可用:非盲评(他知道哪版是新版)、大概率不是分层抽样、顺序固定有锚定 —— 结论区分不了「真更好」和「我期待它更好」。再给当天能做完的路:把这 20 条打乱、隐去来源,找两个没参与开发的同事各判一遍(半小时)→ 同时小流量灰度 5%–10%,用点踩率、重问率、转人工率验证。卡不卡的判据是风险与可逆性,不是有没有走完流程
    信号硬顶「没有评测集不能发」→ 技术对,工程上会让评测体系被全团队视为障碍;按可逆性和风险分级决定卡不卡 → 顶级回答
产品向团队才问的题,门槛却在第 3 层:两个人对不齐时你是改判据还是换人。第 5 层把压力换成组织的 —— 判据是风险与可逆性,不是有没有走完流程。

评分要点

  1. 第一步是拆维度,并意识到大部分「主观」维度其实能代码判或对着参照物判
  2. 形态选择正确:成对比较 > 刻度打分;要绝对值就用多个二元判据 / 合格率
  3. 说得出盲评 + 随机顺序,并知道人也有位置与品牌偏差
  4. pilot 对齐轮 + 标注者间一致率,且知道「人对不齐的维度不进门禁」
  5. 流程细节:双标 + 第三人裁决、黄金题抽检、疲劳控制、分层抽样
  6. 明确人工评测的产出是判据与校准集,终点是让 judge 接手
  7. 结论要过统计关,且看分布不只看均值

常见错误

「主观的东西没法量化,只能人看」放弃了拆维度这一步,其实大部分维度可判
「打 1–5 分取平均」边界主观、随批次漂移、平均分掩盖分布
没有盲评、标注者知道哪版是新版结论无法区分「真更好」和「期待它更好」
「不一致就投票取多数」把最有价值的分歧信息丢掉了
「找几个同事看看」无判据、无抽样设计、无一致性指标
每次发版都全量人工评不可持续;说明 judge 体系没建起来
说不出人工评测和 judge 的分工把最贵的资源用在日常回归上
「新版平均分明显更高」「明显」没有统计定义

关联学习