论文

DiCoBench:通过差异和共性视觉线索对多图像细粒度感知进行基准测试

DiCoBench: Benchmarking Multi-Image Fine-Grained Perception via Differential and Commonality Visual Cues

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 的最新进展展示了令人印象深刻的细粒度感知能力。然而,现有的基准主要依赖于明确的文本提示或低分辨率输入,无法评估模型自主感知高分辨率隐式视觉提示的能力。为了弥补这一差距,我们引入了 DiCoBench,这是一个专为跨图像细粒度感知而设计的综合性多图像高分辨率基准。 DiCoBench 由 765 个精心策划的样本组成,分为两个渐进轨道:差异视觉线索和共性视觉线索,涵盖 8 个不同的感知任务。通过将基准制定为多项选择题任务并利用高分辨率图像(接近 2K),我们消除了评估指标偏差,并对当前最先进的 MLLM 提出了重大挑战。我们对 18 个不同的 MLLM 进行了广泛的评估,结果显示与人类准确率 (98.3\%) 相比存在显着的性能差距,表现最好的模型在微观细节捕捉方面表现得非常困难。我们相信 DiCoBench 将成为一个具有挑战性的测试平台,推动未来自主、高分辨率多图像感知的研究。