生成侧评测:RAGAS 四大件

RAG 工程化进阶6讲解 1

RAGAS 把生成侧拆成 faithfulness(有没有编)、answer relevancy(有没有答到点上)、 context precision / recall(给的证据对不对、全不全)四件,用 LLM-as-Judge 打分。它评的是「基于给定证据答得好不好」,评不了证据本身该不该被召回。

也叫:RAGAS · faithfulness · answer relevancy · context recall · context precision · LLM-as-Judge

生成侧(RAGAS 四大件)出自 T2-8

RAGAS 是最广泛采用的开源评测框架,核心用 LLM-as-Judge 打分。四个指标各盯一种失败模式:

指标 定义 对应的病
Faithfulness(忠实度) 答案里的每条声明能否由检索到的上下文推出 有材料还胡编
Answer Relevancy(答案相关性) 答案是否切中提问 答非所问、答一堆废话
Context Precision(上下文精确度) 检索内容里相关的比例、是否排在前面 噪音太多
Context Recall(上下文召回率) 该检索的信息是否都检索到了 开头故障里失守的那个

面试高频辨析Q2-16):

Faithfulness 管「有没有编」,Answer Relevancy 管「有没有答到点上」。 两者正交:照抄材料但答非所问 → faithfulness 高、relevancy 低;答到点上但添油加醋 → relevancy 高、faithfulness 低。

另一个专业细节:faithfulness 和 answer relevancy 是 reference-free(免参考答案) 的,不需要人工写标准答案,所以能大规模跑;而 context recall 需要标准答案或标注的 gold chunk 才能算准——这也是为什么开头那个团队的仪表盘上没有它。能说出这个差别,说明真的用过。

以上节选自T2-8 RAG 评测:召回率、RAGAS 与 badcase 驱动迭代,读全文能看到前后语境。

考这个知识点的题1

会连带问到5