Embedding 选型与 MTEB

RAG 工程化进阶6讲解 3

选 embedding 模型看四个维度:检索精度看 MTEB 的检索子榜而不是综合分、向量维度不是越大越好、运营适配(多语言 / 许可证 / 托管与自托管)是 2026 年真正的分水岭、稀疏还是稠密还是混合。换模型意味着全量重建索引,所以这是一次性决策。

也叫:Embedding 选型 · MTEB · 向量维度 · embedding 模型

原理拆解:四个选型维度出自 T2-3

选模型不是挑榜首,是拧四个旋钮
检索精度看子榜、维度是成本旋钮、运营适配才是 2026 的分水岭

检索精度MTEB 综合分含分类、聚类这些和 RAG 无关的任务,做 RAG 只看 Retrieval 子榜第二个陷阱:榜单是通用语料,你的领域可能是法律条文、医疗记录、内部代号 —— 哪怕只有 100 条人工标注的「问题 → 正确文档」对,也比榜单可信
向量维度高维 = 表达能力强,同时 = 存储更大、检索更慢;不是越大越好很多场景 1536 维降到 512 甚至 256 维,召回率只掉 1–2%,存储和查询速度提升数倍 —— MRL(套娃表示学习)让直接截断不必重训
运营适配到 2026 年多语言覆盖已不再是差异化因素,分水岭换成了延迟、吞吐、许可证、部署方式每天 1 亿 token 的典型生产负载,闭源 API 与自托管开源模型的月成本可能差一个数量级以上
稀疏 / 稠密 / 混合稠密擅长语义泛化、弱在精确词匹配;稀疏保留词项,擅长专有名词与编号BGE-M3 这类三合一模型同时输出稠密、稀疏、多向量表示,一个模型撑起混合检索(T2-5),省掉维护两套系统

维度那一档的加分答法:「维度是精度和成本的旋钮,我会用评测集测几个档位的 recall@k,选拐点,而不是默认用最大维度。」

许可证是能让整个项目返工的合规问题。部分高分开源模型采用 CC-BY-NC 协议(不可商用),企业场景选型前必须确认 —— 面试时顺口提一句,专业度立刻不一样。

四个维度里只有第一个能在榜单上查到,其余三个都得在你自己的环境里量。所以这题的答案里如果只有一个模型名,等于另外三个约束一个都没考虑过。

维度一:检索精度——**看子榜,别看综合分**

MTEB(Massive Text Embedding Benchmark)是最权威的通用基准,涵盖分类、聚类、检索、重排序、语义相似度等多类任务;中文场景对应 C-MTEB。

这里是第一个陷阱:MTEB 综合分包含大量与 RAG 无关的任务(分类、聚类)。做 RAG 应该只看 Retrieval 子榜。一个模型可能靠聚类拉高了综合分,检索却不如榜下的模型。

第二个陷阱:榜单是通用语料,你的领域可能完全不同(法律条文、医疗记录、内部代号)。最终依据只能是你自己的评测集——哪怕只有 100 条人工标注的「问题→正确文档」对,也比榜单可信。

维度二:向量维度——不是越大越好

维度高 = 表达能力强,但也 = 存储更大、检索更慢。

一个反直觉但重要的事实:很多场景把 1536 维降到 512 甚至 256 维,召回率只掉 1–2%,而存储和查询速度能提升数倍。 现代模型普遍支持维度截断(MRL,套娃表示学习——训练时就让前 N 维承载主要信息,所以可以直接截断而不必重训)。

面试加分答法:「维度是精度和成本的旋钮,我会用评测集测几个档位的 recall@k,选拐点,而不是默认用最大维度。」

维度三:运营适配——2026 年真正的分水岭

到 2026 年,多语言覆盖已经不再是差异化因素(主流开源模型普遍支持 90–100+ 语言),选型决策更多取决于运营适配:延迟、吞吐、许可证、部署方式。

其中最容易被忽略的是成本量级差:一个典型生产负载(每天 1 亿 token),用闭源 API 的月成本与自托管开源模型可能相差一个数量级以上。数据量大的场景,自托管往往是唯一可持续的选择。

还有一个能直接踩雷的点:许可证。 部分高分开源模型采用 CC-BY-NC 协议(不可商用)。企业场景选型前必须确认许可证类型——这是能让整个项目返工的合规问题,面试时提一句会显得很专业。

维度四:稀疏 or 稠密 or 混合

  • 稠密向量(Dense):主流,擅长语义泛化,弱在精确词匹配。
  • 稀疏向量(Sparse / learned sparse):保留词项信息,擅长专有名词、编号。
  • 三合一模型:如 BGE-M3 同时输出稠密、稀疏、多向量表示,一个模型撑起混合检索(见 T2-5),省掉维护两套系统的麻烦。

以上节选自T2-3 Embedding 选型与评测:MTEB、维度与多语言,读全文能看到前后语境。

延伸阅读

考这个知识点的题1

会连带问到5