生成侧评测:RAGAS 四大件
RAGAS 把生成侧拆成 faithfulness(有没有编)、answer relevancy(有没有答到点上)、 context precision / recall(给的证据对不对、全不全)四件,用 LLM-as-Judge 打分。它评的是「基于给定证据答得好不好」,评不了证据本身该不该被召回。
也叫:RAGAS · faithfulness · answer relevancy · context recall · context precision · LLM-as-Judge
生成侧(RAGAS 四大件)出自 T2-8
RAGAS 是最广泛采用的开源评测框架,核心用 LLM-as-Judge 打分。四个指标各盯一种失败模式:
| 指标 | 定义 | 对应的病 |
|---|---|---|
| Faithfulness(忠实度) | 答案里的每条声明能否由检索到的上下文推出 | 有材料还胡编 |
| Answer Relevancy(答案相关性) | 答案是否切中提问 | 答非所问、答一堆废话 |
| Context Precision(上下文精确度) | 检索内容里相关的比例、是否排在前面 | 噪音太多 |
| Context Recall(上下文召回率) | 该检索的信息是否都检索到了 | 开头故障里失守的那个 |
面试高频辨析(Q2-16):
Faithfulness 管「有没有编」,Answer Relevancy 管「有没有答到点上」。 两者正交:照抄材料但答非所问 → faithfulness 高、relevancy 低;答到点上但添油加醋 → relevancy 高、faithfulness 低。
另一个专业细节:faithfulness 和 answer relevancy 是 reference-free(免参考答案) 的,不需要人工写标准答案,所以能大规模跑;而 context recall 需要标准答案或标注的 gold chunk 才能算准——这也是为什么开头那个团队的仪表盘上没有它。能说出这个差别,说明真的用过。
以上节选自T2-8 RAG 评测:召回率、RAGAS 与 badcase 驱动迭代,读全文能看到前后语境。