多模态 RAG(图表、PDF 截图检索)是怎么做的?
谁在问:图表/图纸密集场景的团队(制造、金融研报、医疗影像报告)
口语化问法
- 文档里全是图表和流程图,怎么让 RAG 用起来?
- 听说过 ColPali 吗?它和传统 OCR 路线有什么区别?
- 扫描版的图纸、报表怎么处理?
考察意图
这是场景驱动的进阶题——在制造、金融研报、医疗这类图表密集的行业尤其高频。考察点是:① 你知不知道传统「OCR 转文本」路线的信息损失在哪;② 你了不了解 2026 年「直接把页面当图检索」这条新路线;③ 成本意识——多模态方案贵得多,什么时候值得。
参考答案
60 分答案(及格线)
传统做法是把图表转成文本再走普通 RAG:OCR 抽文字、表格转 Markdown、给图片生成文字描述(caption)。问题是信息损失严重——图表的空间布局、坐标轴关系、流程图的连线方向,转成文本后基本丢光;流程图变成一堆孤立的框名,读不出流向。
多模态 RAG 的思路是不转文本,直接把页面当图像建索引:用视觉语言模型(VLM)把页面图像编码成向量,检索时直接匹配图像;命中后把原图送给多模态大模型作答。ColPali 是这条路线的代表思路。
90 分答案(有生产经验的回答)
补三层:
说清 ColPali 的关键设计:它不是把整页压成一个向量,而是把页面切成图像 patch,每个 patch 一个向量,用类似 ColBERT 的后期交互(late interaction)做细粒度匹配。好处是能定位到「页面里的哪一块」和 query 相关,而不是只知道「这一页大概相关」。同时它跳过了整个解析管线——不用 OCR、不用版面分析、不用表格提取,页面进去向量出来,工程链路大幅简化。
给出代价(本题核心):
- 存储:每页存一组 patch 向量,存储量是单向量方案的数十倍。
- 计算:图像编码和多模态生成都比纯文本贵得多。
- 可读性:检索命中的是图,没有文本可供引用溯源和二次加工,做 citation 更麻烦。
给混合策略(最实用的一层):生产上很少全量走多模态。常见做法是分流——纯文本页走普通 RAG(便宜),图表密集页走多模态索引;或者双路索引:同一页既存文本向量也存图像向量,检索时融合。先统计文档里图表页的占比,占比低就没必要为全库付多模态的成本。
再补 2026 年的变化:多模态模型的成熟改变了这一环的性价比——复杂版面的 PDF(图文混排、多栏、跨页表格)直接交给多模态模型做版面理解,往往比传统解析库调一堆规则更省事。所以策略是规则解析打底,复杂文档兜底给多模态。
追问链
给图片生成 caption 再走文本 RAG,不行吗?
期望能用但有损:caption 是模型对图的一次性概括,它不知道用户将来会问什么 —— 一张 20 个数据点的折线图,caption 只写「某指标的年度变化趋势」,问某年具体数值就答不了。和 embedding 的信息瓶颈同类:压缩时不知道未来的 query信号能类比到「双塔的信息瓶颈」→ 知识是打通的多模态检索命中之后,引用溯源怎么做?
期望比文本难:给页码 + 高亮命中的 patch 区域(ColPali 这类能定位到 patch),或另留一份文本旁路索引专门生成引用文本。要坦承这是当前方案的短板 —— toB 场景引用溯源是硬需求,可能得文本和图像双路并存信号主动说出短板并给折中方案 → 真正评估过落地怎么决定哪些页走多模态、哪些走文本?
期望先做页面分类:轻量规则(文本层字符数占比、图像面积占比)或小模型判断该页是文本主导还是图表主导 → 文本主导走普通链路,图表主导走多模态。分类器本身很便宜,能把多模态成本压到只服务真正需要的那部分页面信号能想到「先分类再分流」→ 有成本治理意识表格到底该走哪条路?
期望分情况:结构规整的表优先转 Markdown 走文本路线(便于精确取数与引用);跨页、合并单元格、嵌套表头这类结构混乱的表转文本容易全乱,走多模态更稳。还可以两路都做:文本路精确查值,图像路理解结构信号能区分「规整表」和「复杂表」→ 处理过真实文档客户的图纸是扫描的老蓝图,模型也认不准,怎么办?
期望先实测再降级:拿 20 张真实图纸测 VLM 的实际识别率,不凭想象 → 不达标就按 ① 只做「定位到哪张图纸」、不承诺读出图上数值,最后一步交给人 → ② 关键参数人工录入建结构化索引,图纸只作附件展示 → ③ 明确告知客户当前能力边界。识别不可靠还硬做端到端问答,是要出事故的信号坚持「多模态模型能解决」、不谈实测和降级 → 缺风险意识;提「降级为定位而非读数」→ 很成熟的产品判断
评分要点
- 能说清传统 OCR/caption 路线的信息损失
- 知道多模态 RAG 是直接对页面图像建索引
- 了解 ColPali 的 patch 级向量 + 后期交互思路
- 能说出存储和计算的代价量级
- 加分:主张分流/混合而非全量多模态
- 加分:意识到引用溯源在图像路线上更难
- 加分:能区分规整表与复杂表走不同路线
- 加分:面对识别不可靠时能给降级方案