论文

VistaHop:长期视觉深度搜索基准测试

VistaHop: Benchmarking Long-Horizon Visual DeepSearch

模型评测智能体系统Agent任务评测基准与评测资源长程任务评测

摘要

视觉深度搜索任务需要多模态 大语言模型 (MLLM) 通过重复检查图像区域、基于视觉证据的推理以及跨多个步骤连接细粒度线索来解决复杂的视觉查询。然而,现有的基准主要评估单步视觉理解或孤立的视觉查询响应生成。它们的难度、搜索范围和单次图像检查都有限,因此无法评估模型跨多个步骤迭代地重新审视视觉证据和推理的能力。在这项工作中,我们介绍了 VistaHop,这是一个专门为评估 Visual DeepSearch 而设计的基准测试。它评估重复图像检查、视觉锚点定位以及跨不同视觉区域的长视野证据遍历。 VistaHop 包含 600 张图像、25 个视觉搜索场景和 600 个视觉深度搜索任务。我们还提出了 VistaArena,一个统一的评估框架,支持基于工具的交互,包括视觉检索、图像检查和基于证据的推理。实验表明,即使是最先进的 MLRM 也远远无法解决 VistaHop,性能最好的模型 SenseNova-MARS-32B 仅达到 26.33% Pass@1。这些发现强调了专门基准和改进的视觉深度搜索代理方法的重要性。