评测与可观测

评测集、judge 的偏差、离线在线鸿沟、trace 与线上质量监控。8 个知识点,对应题库5

入门1

进阶7

进阶17
回归测试与 A/B 的统计关

「涨了两个点」不是结论:同一评测集上的配对检验(McNemar)与置信区间才能说明换模型、换 prompt 是真变好还是噪声。上线走灰度与 A/B,护栏指标兜底;简历里的「效果提升」也要过这一关 —— 和 few-shot 基线比过没有、样本量够不够。

进阶12
离线 / 在线鸿沟

离线分很高、上线效果差,来源有四个:评测集与线上分布脱节、数据泄漏、上下文不一样(离线没有真实的对话历史与工具结果)、指标本身不代表用户要的东西。三条线 —— 能不能发、发完有没有变坏、变坏了怪谁 —— 是本章主线。

进阶5
主观任务与人工评测设计

文案、对话质量这类主观任务,最差的判据是一个 1–5 的总体质量分:标注者之间对不齐, judge 也学不会。可靠的做法是拆成可判的维度、用成对比较代替打分、盲评、写标注指南并量标注者一致性;校准集要多少条,由它替你做多大的决策决定。

进阶8
LLM-as-Judge 的偏差与校准

judge 是一个分类器,要用分类器的标准验收:偏差谱系有量表 —— 位置偏差消不掉只能对冲、自我偏好、冗长偏差。它只在有参照物(参考答案或成对比较)时可靠;校准流程五步,用 Cohen κ 对人工标注验收,judge 本身要版本管理。

进阶19
线上质量监控与金丝雀集

线上没有标准答案,监控分三层且顺序不能反:先系统指标、再代理指标、最后抽样人审或 judge。质量回退归因的第一刀是金丝雀集 —— 一小撮固定样本定期重跑,一变就知道是模型变了、输入变难了还是系统变差了;事故处理先止血再归因树,最后补监控缺口。

进阶8
数据飞轮与用户反馈

点赞点踩是稀疏且有偏的显式信号,隐式信号(重问、复制、放弃)更多但更难解释;用采样器把它们变成待标注队列,错误分析回流成评测集与训练数据,让每次失败都留下资产。指标会反噬 —— 优化点赞率不等于优化质量。

进阶8
trace 字段与 OTel 语义约定

一次多轮 Agent 请求的 trace 里必须记:每次模型调用的输入输出与 token、每次工具调用的参数与结果、模型与提示词版本、成本。OpenTelemetry 的 GenAI 语义约定(gen_ai.*)还在演进,内容捕获要处理 PII 与采样,目标是任何一条失败请求都能重放。