论文
用于多模式 LLM 评估的深度交错文本-图像上下文
Deeply Interleaved Text-Image Contexts for Multimodal LLMs Assessment
摘要
目前多模态模型的评估和训练主要集中在多图像任务上,很大程度上忽略了交错的文本图像场景。在此类多图像任务中,文本通常仅充当任务指令,缺乏与视觉内容的深层语义交互。相比之下,文本图像共同创建、字符跟踪和空间重建等现实应用程序需要文本和图像之间不断交互。因此,模型必须深入了解这些交错的上下文。为了弥补这一差距,我们引入了一种新颖的基准 TIC-Bench(深度交错文本图像上下文),旨在评估模型整合文本图像线索并在深度交错上下文中恢复 真值 事实的能力。该基准测试涵盖三个核心领域:逻辑关联、时间关联和空间关联,并进一步分为八个具体类型,总共包含 2,280 个问题。我们评估了 10 个最先进的 MLLM,发现与人类专家相比存在巨大的性能差距,并且在整合分布在交错的视觉和文本输入中的证据方面持续存在困难。最终,该基准测试提供了一个有价值的分析工具,用于评估和提高多模态模型在深度交错的上下文中有效集成文本和图像信息的能力。 TIC-Bench 可在 https://huggingface.co/datasets/pino10010/TIC-Bench 上公开获取