Embedding 选型与 MTEB
选 embedding 模型看四个维度:检索精度看 MTEB 的检索子榜而不是综合分、向量维度不是越大越好、运营适配(多语言 / 许可证 / 托管与自托管)是 2026 年真正的分水岭、稀疏还是稠密还是混合。换模型意味着全量重建索引,所以这是一次性决策。
也叫:Embedding 选型 · MTEB · 向量维度 · embedding 模型
原理拆解:四个选型维度出自 T2-3
维度那一档的加分答法:「维度是精度和成本的旋钮,我会用评测集测几个档位的 recall@k,选拐点,而不是默认用最大维度。」
许可证是能让整个项目返工的合规问题。部分高分开源模型采用 CC-BY-NC 协议(不可商用),企业场景选型前必须确认 —— 面试时顺口提一句,专业度立刻不一样。
维度一:检索精度——**看子榜,别看综合分**
MTEB(Massive Text Embedding Benchmark)是最权威的通用基准,涵盖分类、聚类、检索、重排序、语义相似度等多类任务;中文场景对应 C-MTEB。
这里是第一个陷阱:MTEB 综合分包含大量与 RAG 无关的任务(分类、聚类)。做 RAG 应该只看 Retrieval 子榜。一个模型可能靠聚类拉高了综合分,检索却不如榜下的模型。
第二个陷阱:榜单是通用语料,你的领域可能完全不同(法律条文、医疗记录、内部代号)。最终依据只能是你自己的评测集——哪怕只有 100 条人工标注的「问题→正确文档」对,也比榜单可信。
维度二:向量维度——不是越大越好
维度高 = 表达能力强,但也 = 存储更大、检索更慢。
一个反直觉但重要的事实:很多场景把 1536 维降到 512 甚至 256 维,召回率只掉 1–2%,而存储和查询速度能提升数倍。 现代模型普遍支持维度截断(MRL,套娃表示学习——训练时就让前 N 维承载主要信息,所以可以直接截断而不必重训)。
面试加分答法:「维度是精度和成本的旋钮,我会用评测集测几个档位的 recall@k,选拐点,而不是默认用最大维度。」
维度三:运营适配——2026 年真正的分水岭
到 2026 年,多语言覆盖已经不再是差异化因素(主流开源模型普遍支持 90–100+ 语言),选型决策更多取决于运营适配:延迟、吞吐、许可证、部署方式。
其中最容易被忽略的是成本量级差:一个典型生产负载(每天 1 亿 token),用闭源 API 的月成本与自托管开源模型可能相差一个数量级以上。数据量大的场景,自托管往往是唯一可持续的选择。
还有一个能直接踩雷的点:许可证。 部分高分开源模型采用 CC-BY-NC 协议(不可商用)。企业场景选型前必须确认许可证类型——这是能让整个项目返工的合规问题,面试时提一句会显得很专业。
维度四:稀疏 or 稠密 or 混合
- 稠密向量(Dense):主流,擅长语义泛化,弱在精确词匹配。
- 稀疏向量(Sparse / learned sparse):保留词项信息,擅长专有名词、编号。
- 三合一模型:如 BGE-M3 同时输出稠密、稀疏、多向量表示,一个模型撑起混合检索(见 T2-5),省掉维护两套系统的麻烦。
以上节选自T2-3 Embedding 选型与评测:MTEB、维度与多语言,读全文能看到前后语境。