论文

连贯性:交错多模态环境中细粒度图像文本对齐的基准测试

COHERENCE: Benchmarking Fine-Grained Image-Text Alignment in Interleaved Multimodal Contexts

模型评测基准与评测资源

摘要

近年来,多式联运 大语言模型 (MLLM) 在各种多式联运基准测试中取得了显着进展。尽管取得了这些进步,但大多数现有基准主要集中在单图像或多图像理解上。在文档阅读等现实场景中,信息通常以交错的多模型上下文的形式呈现。这要求 MLLM 不仅要识别单个图像的内容,还要识别相关的文本和视觉证据,在它们之间建立细粒度的对齐,并根据上下文证据对交错上下文中的这些对齐信号进行推理。然而,仍然缺乏系统的基准来量化 MLLM 在交错图像文本上下文中的细粒度理解能力。为了填补这一空白,我们提出了 COHERENCE,这是一个旨在评估 MLLM 在交错多模态上下文中恢复细粒度图像-文本对应关系的能力的基准。 COHERENCE 涵盖来自四个代表性领域的交错图像文本内容,并包含 6,161 个高质量问题。此外,我们还执行六种类型的错误分析,将交错图像文本理解中的失败细粒度归因于当前 MLLM 中缺少的特定功能。