怎么考「什么是 Agentic RAG?和固定管线比强在哪、贵在哪?

Q2-19Agentic RAG高频

谁在问:头部 AI 公司一二面;2026 年 RAG 话题的新标配问题

开场怎么问

你了解 Agentic RAG 吗?和普通 RAG 有什么不一样?

换个问法

  • 什么情况下固定的检索管线不够用?
  • Agentic RAG 成本会涨多少?你们怎么控?

五层追问链

左边照着问,右边对着听。最后一层是压力面,不必每个候选人都问到。

怎么防止它无限循环烧钱?

期望
硬性上限——最大检索轮次(通常 3–5 轮)、总 token 预算、单次请求超时;检测重复检索(同样的 query 检索两次就强制终止);达到上限时降级为「基于已有材料尽力回答 + 说明信息可能不完整」,而不是直接报错。
信号
这是最实用的探针。没设过上限的人答不出具体轮次和降级策略。

Agentic RAG 怎么评测?和传统 RAG 有什么不同?

期望
不能只看最终答案,要看轨迹——检索了几轮(是否冗余)、路由对不对、每轮的 query 是否合理、有没有该检索却没检索。因为答案对了也可能是绕了五轮碰运气,成本和稳定性都不可接受。详见 Q5-05
信号
只说「看答案准确率」的,没做过 Agent 系统的评测。

什么场景你会明确不用它?

期望
单跳事实问答(固定管线足够且快得多)、延迟敏感的对话产品、成本敏感的高并发场景、决策稳定性要求高的关键业务。答不出反例的,说明是背来的。
信号
坚持「Agentic 全面更好」的,缺乏工程判断。

Agentic RAG 和 GraphRAG 是竞争关系吗?

期望
不是——Agentic 是决策层,Graph 是数据层,前者可以把后者当作工具之一来调用。2026 年的成熟架构通常是 Advanced RAG 作基座 + Agentic 作调度层 + Graph/SQL/Web 作可选数据源
信号
能说清这个分层关系的,知识是成体系的而非碎片。

你上了 Agentic RAG,效果只提升了 5%,成本涨了 3 倍,怎么向老板交代?

期望
先承认这是方案选错场景而不是技术问题——回去做分桶分析,看提升集中在哪类 query(大概率是少数多跳问题);解法是分级路由:只把这一类 query 走 Agentic 路径,其余走固定管线,把 3 倍成本压回到那一小部分流量上。同时给出可量化的复盘:这类 query 占比多少、单次成本多少、值不值。关键是展示「不硬撑、能止损、给数据」的态度。
信号
强行论证「长期看值得」而给不出数据的,是典型的沉没成本思维。

危险信号

听到这些话,基本可以判定是背题而不是做过。

只讲优点不讲代价——最典型的二手知识特征。
说不出任何具体组件,停留在「让 Agent 自己决定」的抽象描述。
没有轮次上限和成本兜底的概念。
把 Agentic RAG 和多轮对话混为一谈(前者是单次请求内的多轮检索,后者是用户的多轮交互)。
认为它能取代 Advanced RAG 而不是建立在其之上。

评分卡

  1. 说清与固定管线的核心差异(检索从一次性变成自主循环)
  2. 能列出关键组件(Router / 多 Retriever / Memory / ReAct 循环)
  3. 能说出成本、延迟、稳定性三方面的代价
  4. 知道要设最大轮次和预算上限
  5. 加分:能给出「轻量分类器 + 预定义策略」的中间方案
  6. 加分:能说出明确不该用的场景
  7. 加分:能说清与 GraphRAG 的分层关系
参考答案与考察意图面试中途别看这一段

考察意图

2026 年这个概念的知晓率已经很高,能背定义不构成优势。面试官真正在看:① 你能不能说清「贵在哪」——只讲优点的回答一律判为二手知识;② 你有没有「什么时候不该用」的判断;③ 有没有中间方案的意识——不是只有「固定管线」和「全 Agent」两个极端。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

传统 RAG 是固定流水线:检索一次 → 生成。Agentic RAG 把检索变成 Agent 的工具,由模型自己决策:判断需不需要检索、检索什么、看完结果够不够、不够就换个角度或换个数据源再检索一轮,直到能回答为止。

强在动态多轮检索(根据中间结果决定下一步)、多数据源组合(向量库、BM25、SQL、Web 搜索按需调用)、自我修正(结果不相关时能重来,而不是硬拿噪音作答)。适合多跳推理、多文档对比这类固定管线答不了的问题。

90

90 分答案(有生产经验的回答)

补三层:

说清关键组件:Router(判断 query 类型路由到合适数据源)、多个 Retriever、Memory(维护对话历史支持上下文感知检索)、ReAct 循环(思考-行动-观察,迭代至答案完整)。

贵在哪(必答的另一半)

  • 成本:每次决策都要调一次 LLM,整体可能是传统 RAG 的数倍。
  • 延迟:多轮循环让首字延迟从几百毫秒涨到秒级,对话式产品要慎重。
  • 稳定性:模型的决策能力仍不够可靠,会出现「明明该检索却直接答」「反复检索同一个东西」,必须设最大轮次和 token 预算兜底。

给中间方案(最加分的一层):不必每次都让 LLM 深度思考——预定义几种检索策略,用轻量分类器选择,只在复杂 query 上启用完整 Agent 循环。既拿到大部分收益,又避免成本失控。这个「简化版 Agentic」的判断,比复述架构图有价值得多。

再补一句定位:到 2026 年 Agentic RAG 已被广泛视为企业复杂问答落地的事实标准,但「事实标准」指的是复杂场景——80% 的常规单跳问答,Advanced RAG 仍然够用且更便宜

攒够了去组卷页一键生成可打印的面试题单