论文

SIGNPOST-Bench:多模式中文本视觉冲突解决基准测试 大语言模型

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 通过结合视觉和文本线索在现实场景中做出有根据的预测,但现有的基准很少揭示它们在这些证据来源发生冲突时如何在这些证据来源之间进行仲裁。我们引入了 SIGNPOST-Bench,这是一种用于评估文本视觉冲突解决方案的受控反事实基准。每个源图像都被转换为原始、空白、相似、随机和对抗变体的反事实五元组。合成的本地化场景文本干预旨在保留非文本内容,从而能够对本地化性能的变化进行配对测量,并定向转向由冲突文本引入的地理目标。 SIGNPOST-Bench 包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。我们评估了来自 7 个提供商的 20 个 MLLM。与原始图像相比,对抗变体将中位定位误差从 282 公里提高到 1,347 公里,增加了 4.8 倍。在可地理编码的对抗样本中,6.5-20.1% 的预测距离跨模型的注入目标不到 50 公里,并且每个评估模型都表现出从空白到对抗的目标距离的正平均配对减少。兼容、不相关和冲突的文本替换会对模型预测产生不同的影响,而干净输入的本地化性能并不能完全预测冲突文本的鲁棒性。这些结果将视觉地理定位确立为场景文本仲裁的连续诊断,并提供了一个用于评估 MLLM 如何解决冲突的多模态证据的受控框架。