怎么考「多模态 RAG(图表、PDF 截图检索)是怎么做的?

Q2-22多模态 RAG进阶

谁在问:图表/图纸密集场景的团队(制造、金融研报、医疗影像报告)

开场怎么问

文档里全是图表和流程图,怎么让 RAG 用起来?

换个问法

  • 听说过 ColPali 吗?它和传统 OCR 路线有什么区别?
  • 扫描版的图纸、报表怎么处理?

五层追问链

左边照着问,右边对着听。最后一层是压力面,不必每个候选人都问到。

给图片生成 caption 再走文本 RAG,这个方案不行吗?

期望
能用但有损——caption 是模型对图的一次性概括,它不知道用户将来会问什么,所以细节必然丢失(一张有 20 个数据点的折线图,caption 只会说「展示了某指标的年度变化趋势」,问具体某年数值就答不了)。和 embedding 的信息瓶颈是同一类问题:压缩时不知道未来的 query。
信号
能类比到「双塔的信息瓶颈」的,知识是打通的。

多模态检索命中之后,引用溯源怎么做?

期望
比文本难——可以给出页码 + 高亮命中的 patch 区域(ColPali 这类方案能定位到 patch),或者保留一份文本旁路索引用于生成引用文本。要坦承这是当前方案的短板,toB 场景里引用溯源是硬需求,可能需要文本和图像双路并存。
信号
能主动说出短板并给折中方案的,是真正评估过落地。

怎么决定哪些页走多模态、哪些走文本?

期望
先做页面分类——用轻量规则(文本层字符数占比、图像面积占比)或小模型判断该页是文本主导还是图表主导;文本主导走普通链路,图表主导走多模态。这个分类器本身很便宜,能把多模态成本压到只服务真正需要的那部分页面。
信号
能想到「先分类再分流」的,有成本治理意识。

表格到底该走哪条路?

期望
分情况——结构规整的表优先转 Markdown 走文本路线(便于精确取数、便于引用);跨页、合并单元格、嵌套表头这类结构混乱的表,转文本容易全乱,走多模态更稳。还可以两路都做:文本路用于精确查值,图像路用于结构理解。
信号
能区分「规整表」和「复杂表」的,处理过真实文档。

客户的图纸是扫描的老蓝图,模型也认不准,怎么办?

期望
坦诚技术边界——先评估 VLM 在样本上的实际识别率(拿 20 张真实图纸测,不要凭想象);识别率不达标时的务实路径:① 让系统只做「定位到哪张图纸」而不承诺读出图上的数值,把最后一步交给人;② 关键参数走人工录入建结构化索引,图纸只作为附件展示;③ 明确告知客户当前能力边界。在识别不可靠的场景硬做端到端问答,是要出事故的。
信号
坚持「多模态模型能解决」而不谈实测和降级的,缺乏风险意识;能提出「降级为定位而非读数」的,是很成熟的产品判断。

危险信号

听到这些话,基本可以判定是背题而不是做过。

认为「用多模态模型就行了」,不谈成本和存储。
不知道 caption 路线的信息损失在哪。
把多模态 RAG 理解成「OCR + 普通 RAG」——这恰恰是它要取代的方案。
完全不考虑引用溯源。
面对识别质量问题只会说「换个更强的模型」。

评分卡

  1. 能说清传统 OCR/caption 路线的信息损失
  2. 知道多模态 RAG 是直接对页面图像建索引
  3. 了解 ColPali 的 patch 级向量 + 后期交互思路
  4. 能说出存储和计算的代价量级
  5. 加分:主张分流/混合而非全量多模态
  6. 加分:意识到引用溯源在图像路线上更难
  7. 加分:能区分规整表与复杂表走不同路线
  8. 加分:面对识别不可靠时能给降级方案
参考答案与考察意图面试中途别看这一段

考察意图

这是场景驱动的进阶题——在制造、金融研报、医疗这类图表密集的行业尤其高频。考察点是:① 你知不知道传统「OCR 转文本」路线的信息损失在哪;② 你了不了解 2026 年「直接把页面当图检索」这条新路线;③ 成本意识——多模态方案贵得多,什么时候值得。

参考答案

图 2 · 60 分与 90 分差在哪:代价、演进、怎么验证

60

60 分答案(及格线)

传统做法是把图表转成文本再走普通 RAG:OCR 抽文字、表格转 Markdown、给图片生成文字描述(caption)。问题是信息损失严重——图表的空间布局、坐标轴关系、流程图的连线方向,转成文本后基本丢光;流程图变成一堆孤立的框名,读不出流向。

多模态 RAG 的思路是不转文本,直接把页面当图像建索引:用视觉语言模型(VLM)把页面图像编码成向量,检索时直接匹配图像;命中后把原图送给多模态大模型作答。ColPali 是这条路线的代表思路。

90

90 分答案(有生产经验的回答)

补三层:

说清 ColPali 的关键设计:它不是把整页压成一个向量,而是把页面切成图像 patch,每个 patch 一个向量,用类似 ColBERT 的后期交互(late interaction)做细粒度匹配。好处是能定位到「页面里的哪一块」和 query 相关,而不是只知道「这一页大概相关」。同时它跳过了整个解析管线——不用 OCR、不用版面分析、不用表格提取,页面进去向量出来,工程链路大幅简化。

给出代价(本题核心)

  • 存储:每页存一组 patch 向量,存储量是单向量方案的数十倍。
  • 计算:图像编码和多模态生成都比纯文本贵得多。
  • 可读性:检索命中的是图,没有文本可供引用溯源和二次加工,做 citation 更麻烦。

给混合策略(最实用的一层):生产上很少全量走多模态。常见做法是分流——纯文本页走普通 RAG(便宜),图表密集页走多模态索引;或者双路索引:同一页既存文本向量也存图像向量,检索时融合。先统计文档里图表页的占比,占比低就没必要为全库付多模态的成本。

再补 2026 年的变化:多模态模型的成熟改变了这一环的性价比——复杂版面的 PDF(图文混排、多栏、跨页表格)直接交给多模态模型做版面理解,往往比传统解析库调一堆规则更省事。所以策略是规则解析打底,复杂文档兜底给多模态

攒够了去组卷页一键生成可打印的面试题单