引用溯源与拒答
引用溯源要求模型的每句结论都能指回具体 chunk,防「标了引用却胡编」靠事后校验:引用的 chunk 里必须真的包含该结论。检索分数低于阈值时兜底说「不知道」,比硬答一个漂亮的错误答案更值钱。
也叫:引用溯源 · citation · grounding · 拒答 · 说不知道 · 阈值兜底
引用溯源与「说不知道」出自 T2-8
两个 toB 场景的硬需求,也常被追问(Q2-24):
- 引用溯源:让模型在答案里标出每句话来自哪个 chunk。实现上给每个 chunk 编号后要求模型输出引用编号,再在后处理做一次校验——模型标错引用是常见现象,校验不通过就降级为「无法确定出处」。
- 说不知道:prompt 里明确「材料中没有则回答不知道」只是第一步,更有效的是设检索分数阈值——最高分低于阈值直接走兜底话术,根本不进生成。评测集里那类「知识库没有答案」的问题就是用来调这个阈值的。
以上节选自T2-8 RAG 评测:召回率、RAGAS 与 badcase 驱动迭代,读全文能看到前后语境。
考这个知识点的题2 道
会连带问到13 道
- Q1-05大模型为什么会幻觉?应用层能做哪些缓解?
- Q2-05表格、代码、扫描件这类「脏文档」怎么处理进 RAG?
- Q2-15RAG 的召回率怎么评估?测试集从哪来?
- Q2-16RAGAS 这类框架评的是什么?faithfulness 和 answer relevancy 有何区别?
- Q2-17用户说「答非所问」,你怎么归因是检索问题还是生成问题?
- Q2-18说一个你处理过的最难的 RAG badcase
- Q2-23知识库更新了,向量索引怎么增量更新?删除的文档怎么办?
- Q3-25从零设计一个能查库存、能下单的电商客服 Agent,讲讲整体架构
- Q8-01给制造业设计一个设备手册问答系统,讲完整方案
- Q8-03设计一个工单自动处理 Agent:分类、查询、升级转人工
- Q8-04设计一个合同审查助手:长文档、条款比对、风险标注
- Q8-08设计给老板的「用嘴查数」系统(NL2SQL),准确率不够怎么兜底?
- Q8-10系统日活从 100 涨到 10 万,架构要变什么?