论文

MMLongEmbed:长上下文场景中多模态嵌入模型的基准测试

MMLongEmbed: Benchmarking Multimodal Embedding Models in Long-Context Scenarios

模型评测基准与评测资源

摘要

最近的进展显着扩展了多模态嵌入模型(MEM)的理论背景窗口。然而,较大的上下文窗口并不一定能转化为长上下文多模式输入的有效理解和表示,这仍然是现实世界部署的关键瓶颈。为了解决这种情况下缺乏系统评估的问题,我们引入了 MMLongEmbed,这是第一个在长上下文场景中评估 MEM 的综合基准。 MMLongEmbed 包含四个检索任务,跨越多个上下文长度范围,涵盖文本、文档和视频模式。通过对最先进模型的广泛评估,我们发现当前的架构严重依赖于表面特征匹配,并且难以捕获深层语义和结构依赖性。我们进一步观察到,性能下降随着上下文长度和关键信息放置而系统地变化。此外,模型对跨模态的冗余上下文信息表现出截然不同的鲁棒性。为了可重复性,基准测试和代码是公开的。