论文
前沿大语言模型能匹敌原生多模态嵌入吗?困难负样本文生图检索上的对比
Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval
摘要
跨文本、图像、视频和音频等不同媒体类型的多模态检索与分类,传统上依赖通过对比学习对齐视觉与文本表征的双编码器模型。2026年3月发布的Gemini Embedding 2是谷歌首个将文本、图像、视频、音频和文档映射到单一共享空间的原生多模态嵌入模型,这加剧了多模态检索系统之间的竞争。与此同时,前沿大语言模型(LLM)也展现出强大的视觉理解能力,引出了它们能否充当有效零样本排序器的问题。我们的研究在Flickr30k上首次直接对比原生多模态嵌入与基于LLM的视觉排序。我们观察到GPT-4.1和Claude Sonnet 4.6与Gemini Embedding 2表现相当。此外,一旦嵌入被预先计算,多模态嵌入更适合低延迟应用。
