论文

Gemini Embedding 2:Gemini 的原生多模态嵌入模型

Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini

模型训练预训练

摘要

我们引入了 Gemini Embedding 2,这是一种原生多模态嵌入模型,允许在统一的表示空间中嵌入视频、音频、图像和文本模态。我们利用 Gemini 的多模态功能为所有这些模态的交错输入的任意组合生成嵌入,这些模态可以很好地泛化到各种任务中。在多任务多阶段训练设置中应用大规模对比学习,我们在关键嵌入基准上实现了最先进的性能,包括跨越不同任务集的单模态、跨模态和多模态检索。我们的嵌入模型在各种任务中表现出了强大的性能(在 MSCOCO 上得分为 62.9 R@1,在 Vatex 上得分为 68.8 NDCG@10,在 MTEB 多语言上得分为 69.9,在 MTEB 代码上得分为 84.0),超越了专用模型的性能。这些统一的功能使 Gemini Embedding 2 成为 RAG、推荐和搜索等下游用例的有希望的候选者。此外,它在不同领域(从天文学和生物科学到美术和烹饪艺术)的强大零样本性能使其成为高度可靠、开箱即用的代表,即使对于专业领域也是如此。