论文

针对多语言密集检索和 RAG 系统的开源模型对 Google Embeddings 2 进行基准测试

Benchmarking Google Embeddings 2 against Open-Source Models for Multilingual Dense Retrieval and RAG Systems

模型评测模型能力评测

摘要

我们将 Google Embeddings (GE2)(一种 Vertex-AI 托管的双编码器,具有 2,048 个词元上下文和显式任务类型调节)与五个开源替代方案进行了基准测试:BGE-M3、E5-large、Multilingual-E5-large (mE5-L)、LaBSE 和 Paraphrase-Multilingual-MPNet (mMPNet)。评估涵盖四个 BEIR 子集、一个合成的意大利 RAG 语料库、考虑 5 种大小的词元和三种策略的分块消融,以及商用 CPU 硬件上的每个查询延迟。 GE2 在每项任务上均排名第一,达到 BEIR avg.nDCG@10 = 0.638 和 IT-RAG-Bench nDCG@10 = 0.282,但中位延迟为 231.6 毫秒,比最快的本地模型大约慢 14 倍。 mE5-L 在意大利语上的运行时间为 31 毫秒,与 GE2 的误差在 0.003 nDCG 以内,这使其成为 100 毫秒以下 SLA 重要时的首选。一个更引人注目的发现涉及 LaBSE,尽管广泛的多语言部署,它在 BEIR 上的平均 nDCG@10 得分为 0.188,低于包括 mMPNet 在内的每个专用检索模型。分块实验表明,所有六个模型在我们的语料库上都在 32 个标记块处饱和,而语义分块仅在 16 个标记处提供可测量的增益。