论文
HoloCount:MLLM 的整体视觉计数基准
HoloCount: A Holistic Visual Counting Benchmark for MLLMs
摘要
视觉计数是多模式智能的基本支柱,需要细粒度基础和空间推理的无缝集成。虽然多模态 大语言模型 (MLLM) 在定性场景理解方面取得了显着的成功,但其定量精度仍然是一个重大瓶颈,通常以持续的数字幻觉为特征。现有的计数基准主要关注简化环境中的基本感知,未能捕获逻辑约束或对抗条件下出现的复杂故障模式。为了解决这些限制,我们引入了 HoloCount,这是一个围绕三级分层分类法构建的全面且诊断丰富的基准。 HoloCount 通过以下方面评估 MLLM:(1)语义计数,重点关注原子和基于属性的枚举; (2) 分析计数,通过空间和基于集合的推理评估逻辑构成; (3) 稳健性测试,针对不利场景和扎根的反先验(例如高密度场景和语言偏差)探测模型的完整性。通过对 20 多个最先进的 MLLM 进行详尽的评估,我们揭示了一个关键的性能差距:当任务从感知过渡到复杂的分析推理和不利场景时,即使是顶级模型也会显着退化。我们的研究结果提供了当前 MLLM 计数能力的系统概况,并为开发更扎实、更可靠的多模式系统提供了路线图。该数据集可在 https://mm-mvr.github.io/HoloCount/ 获取。