论文
VisualNeedle:信息密集场景中主动视觉搜索的基准测试
VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes
摘要
据报道,Frontier 多模态 大语言模型 (MLLM) 在细粒度感知基准上实现了超过 90% 的准确度。然而,这样的分数并不一定意味着视觉证据的忠实使用。之前的研究已经确定了三种提高基准性能的捷径。首先,问题中的语言先验和词汇线索通常使模型能够在不看到图像的情况下推断出合理的答案。其次,来自视觉编码器的粗略全局语义可以绕过细粒度的局部细节。第三,在一些“用图像思考”基准测试中,破坏视觉工具返回的中间图像几乎不会影响最终答案。这些发现表明,较高的输入分辨率或较大的问题池本身并不能引发真正的主动视觉搜索。为了解决这个问题,我们引入了 VisualNeedle,这是一个具有挑战性、信息密集且细粒度的基准,适用于关键证据在空间上仅限于微小区域且一眼无法辨别的场景。我们进一步提出了一种反事实的裁剪黑色设置,用相同大小的黑色图像替换工具返回的裁剪,以测试工具启用的性能是否真正依赖于中间视觉证据。我们在四种设置中评估了 9 个著名的 MLLM:纯文本、无工具、有工具和裁剪黑色。纯文本准确率保持在 10% 以下,而没有工具的准确率则保持在 20% 以下。最好的工具支持模型仅达到 56.00%,仍然落后于人类多数投票的 63.00% 准确率。这些结果揭示了细粒度视觉搜索的持续局限性,而作物黑色消融证实了 VisualNeedle 的成功取决于真正的中间视觉证据。