5 章 · 评测与可观测

10 道。

Q5-01
AI 应用上线前怎么评测?评测集怎么建、多少条起步?
评测与可观测高频
Q5-02
离线评测分很高,上线效果差——可能出了什么问题?
评测与可观测高频
Q5-03
LLM-as-Judge 是什么?它自己有哪些偏差?怎么校准?
评测与可观测高频
Q5-04
主观任务(文案 / 对话质量)怎么评?人工评测怎么设计才靠谱?
评测与可观测常见
Q5-05
Agent 的轨迹评估和单轮问答评估有什么不同?
评测与可观测常见
Q5-06
一次多轮 Agent 请求的 trace 里应该记哪些东西?
评测与可观测高频
Q5-07
线上怎么发现质量回退?没有标准答案的场景怎么定监控指标?
评测与可观测常见
Q5-08
换了新模型 / 新 prompt,怎么科学地做回归测试和 A/B?
评测与可观测高频
Q5-09
用户点赞点踩怎么用起来,形成数据飞轮?
评测与可观测常见
Q5-10
印象最深的一次线上质量事故,怎么定位和修的?
评测与可观测高频