主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?
谁在问:产品向团队;内容/对话类业务的二面
口语化问法
- 文案好不好这种东西没法量化吧?你们怎么评的?
- 你们做人工评测吗?怎么组织的、几个人标、怎么保证标得准?
- 对话质量这种主观指标,你怎么向老板证明新版更好?
考察意图
这道题表面问「主观任务」,实际在测三件事:
- 你会不会把「主观」当成放弃量化的借口。 好的回答第一步一定是拆维度——拆完你会发现大部分所谓主观维度其实是客观的。
- 你懂不懂人也是有偏差的评判者。 位置偏差、疲劳、锚定、品牌预期,人一样有。不做盲评和随机化的人工评测,结论未必比 judge 可信。
- 你知不知道人工评测的产出是什么。 新手以为产出是「一个分数」,做过的人知道产出是判据和校准集——它的终点是让 judge 能接手。
参考答案
60 分答案(及格线)
主观任务我们会做人工评测。找几个人对新旧两版打分,比如 1–5 分,然后取平均看哪版高。为了避免主观,我们会写一个评分标准,说明什么样算 5 分、什么样算 3 分。样本量大概几十条,每条至少两个人标,不一致的再讨论。最后如果新版平均分明显高,就上线。
方向都对:有标准、有多人、有分歧处理。所以能过。
它止步于 60 分的原因是——没有盲评、没有随机化、没有一致性指标、没有显著性,而且默认了「1–5 分取平均」这个最容易出问题的形态。「明显高」是多少?0.2 分算不算?
90 分答案(有生产经验的回答)
我分四步:先拆维度,再选形态,再设计流程,最后说这件事的真正产出。
一、先拆维度——「主观」这个词往往是没拆导致的。 「文案好不好」拆开之后,通常是这样一个漏斗:
- 能用代码判的(占比比想象中大):字数区间、是否含必要要素(品牌名、价格、行动号召)、是否含禁用词与违规表述、结构是否符合模板、有没有编造数字。这一层直接写断言,零成本零噪声。
- 能对着参照物判的:是否忠于素材(不超出给定的产品信息)、是否覆盖了 brief 里点名的卖点。有参照物,可以交给 judge。
- 真正只能人判的:语感、调性是否符合品牌、有没有「广告味」、笑点会不会尬。通常只剩一两条。
关键判断:先把前两层榨干,再动用人。 人工评测是整个体系里最贵的资源,用在能代码判的地方是纯粹浪费。
二、形态上,成对比较优于绝对打分。 人对「这两个哪个更好」的判断稳定,对「这个几分」的判断极不稳定——同一个人隔一周打分能差 0.5,而且会随着看过的样本漂移(前面看了一批烂的,后面的都显得好)。所以我们的默认形态是盲态成对比较:两版并排、隐藏来源、随机左右顺序。 需要绝对分数的场合(比如要报一个「合格率」),也不打 1–5,而是拆成多个二元判据:调性符合(是/否)、有无广告味(是/否)、是否可直接发布(是/否)。二元判据的标注一致率远高于刻度打分。
三、流程上有五条是必须的:
- 盲评 + 随机化——人也有位置偏差和品牌预期偏差,「这是我们新版」一说出口,结论就废了。
- 先跑一轮对齐(pilot):20–30 条,两三个人独立标,算标注者间一致率。人和人都对不齐的判据,不是判据,是意见。 这一轮的产出是改判据,不是出结论。
- 每条至少两人标,分歧的第三人裁决,并且把分歧样本单独留档——它们是判据最需要修的地方。
- 混入黄金题(已知答案的样本,占 5%–10%)监测标注质量,防止疲劳期乱标。
- 控制批量与疲劳:单人单次不超过一小时/几十条;分层抽样而不是只标典型样本。
四、这件事的真正产出,不是分数,是判据和校准集。 人工评测太贵,不可能每次改动都跑。它的正确定位是:用人工标注出一批高质量样本,去校准一个 judge,然后让 judge 承担日常回归,人只在校准和抽检时出场。 所以我们对一次人工评测的验收标准是两条——判据被改到人和人能对齐;产出的标注集能把 judge 的一致性顶到可用线。
最后,出结论时要过统计关:小样本上 5% 的差距很可能是噪声,成对比较要按结论翻转的样本算显著性,而不是比平均分。
追问链
「调性符合品牌」这种维度,怎么写成能标的判据?
期望判据要写成可证伪的形式,不能写成形容词:「专业」不可标,「不使用网络流行语」「不使用第二人称祈使句」「术语用行业标准称谓」可标。正反例是判据的一部分,反例比正例重要 —— 反例才划得出边界;实在写不出就降级成成对比较,比强行发明一个刻度可靠信号只说「写清楚评分标准」→ 没写过;给得出「把形容词换成可观察行为」的具体例子,或提判据版本号 → 做过为什么不用 1–5 分?平均分不是更方便看趋势吗?
期望刻度打分三个毛病:相邻刻度边界主观(3 和 4 差在哪两个人对不齐)、随批次漂移、平均分掩盖分布(一批 3 分和「一半 5 分一半 1 分」均值相同,产品含义完全相反)。替代是二元判据 × 多维度,或成对比较;非要一个数就用合格率,有产品含义且能直接当门禁信号说不出「平均分掩盖分布」→ 没被这件事坑过;主动说「看分布不看均值,尤其看最差那一档的比例」→ 做过内容质量两个标注者一直对不齐怎么办?
期望第一反应是改判据,不是换人、不是投票取多数:捞出分歧样本逐条看,通常是两条标准在打架或某个词有歧义 → 三选一处理(拆成两条 / 补正反例 / 判定不可标、降级为参考指标)。硬判据是人对不齐的维度永远不进发布门禁,也别指望 judge 学得会信号说「投票取多数」或「换个更专业的标注者」→ 把最有价值的分歧信息丢了;能认出「有些分歧是需求没对齐,不是标注问题」→ 很成熟人工评测多久做一次?多少条?成本怎么控?
期望不是定期做,是按触发做:判据变了、模型或 prompt 大改、judge 一致率掉了、新增渠道。规模按用途:校准 judge 每判据 20–30 条起,做门禁的 judge 要 100 条起,抽检每周十几条。控成本靠分工:人管校准与抽检、judge 管日常回归、代码管所有硬约束信号说「每次发版都全量人工评」→ 不可持续,也说明 judge 体系没建;说「人工评测的量应该随时间下降」→ 很强的信号产品经理说他自己看了 20 条,感觉新版明显更好,让你直接发,你怎么办?
期望不否定他,先指出这 20 条为什么不可用:非盲评(他知道哪版是新版)、大概率不是分层抽样、顺序固定有锚定 —— 结论区分不了「真更好」和「我期待它更好」。再给当天能做完的路:把这 20 条打乱、隐去来源,找两个没参与开发的同事各判一遍(半小时)→ 同时小流量灰度 5%–10%,用点踩率、重问率、转人工率验证。卡不卡的判据是风险与可逆性,不是有没有走完流程信号硬顶「没有评测集不能发」→ 技术对,工程上会让评测体系被全团队视为障碍;按可逆性和风险分级决定卡不卡 → 顶级回答
评分要点
- 第一步是拆维度,并意识到大部分「主观」维度其实能代码判或对着参照物判
- 形态选择正确:成对比较 > 刻度打分;要绝对值就用多个二元判据 / 合格率
- 说得出盲评 + 随机顺序,并知道人也有位置与品牌偏差
- 有pilot 对齐轮 + 标注者间一致率,且知道「人对不齐的维度不进门禁」
- 流程细节:双标 + 第三人裁决、黄金题抽检、疲劳控制、分层抽样
- 明确人工评测的产出是判据与校准集,终点是让 judge 接手
- 结论要过统计关,且看分布不只看均值