第 5 章 · 评测与可观测
共 10 道。
Q5-01
AI 应用上线前怎么评测?评测集怎么建、多少条起步?
Q5-02
离线评测分很高,上线效果差——可能出了什么问题?
Q5-03
LLM-as-Judge 是什么?它自己有哪些偏差?怎么校准?
Q5-04
主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?
Q5-05
Agent 的轨迹评估和单轮问答评估有什么不同?
Q5-06
一次多轮 Agent 请求的 trace 里应该记哪些东西?
Q5-07
线上怎么发现质量回退?没有标准答案的场景怎么定监控指标?
Q5-08
换了新模型 / 新 prompt,怎么科学地做回归测试和 A/B?
Q5-09
用户点赞点踩怎么用起来,形成数据飞轮?
Q5-10
印象最深的一次线上质量事故,怎么定位和修的?