论文
MMEB-V3:测量全模态嵌入模型的性能差距
MMEB-V3: Measuring the Performance Gaps of Omni-Modality Embedding Models
摘要
多模态嵌入模型旨在将文本、图像、视频和音频等异构输入映射到共享语义空间。然而,现有的方法和基准仍然很大程度上局限于部分模态覆盖,使得很难系统地评估全模态表示学习。在这项工作中,我们向全模态设置迈出了一步。我们推出了 MMEB-V3,这是一个综合基准测试,可评估文本、图像、视频、音频以及以代理为中心的场景中的嵌入。为了实现更细粒度的诊断,我们进一步构建了 OmniSET(全模态语义等效元组),其中语义等效的实例跨模态表示,使我们能够将语义相似性与模态效应分开。通过 MMEB-V3 的实验,我们对全模态嵌入进行了系统分析,并确定了三个关键发现:(1)模型通常无法检索预期的目标模态; (2)跨模态检索高度不对称,并以查询模态偏差为主导; (3)指令引起的转变要么不充分,要么与目标模态不一致,因此不能可靠地改善检索。这些结果表明,当前的多模态嵌入尚不能可靠地执行指令指定的模态约束,因此无法表现出一致的模态感知检索行为。我们希望 MMEB-V3 为理解和诊断这些局限性提供有用的基准,并指导未来的全模态嵌入研究。