论文
PixelEyes:将感知和推理解耦以寻求精确的视觉证据
PixelEyes: Decoupling Perception and Reasoning for Pinpoint Visual Evidence Seeking
摘要
本文探讨了多轮视觉推理,并观察到 MLLM 多次无法定位目标,从而导致长且冗余的轨迹。我们将这种失败归因于单个模型中推理和感知的纠缠,MLLM 同时进行推理和定位,并且不准确的定位会触发额外的推理转向,从而使轨迹膨胀。为了解决这个问题,我们提出了 PixelEyes,一种多轮视觉推理代理,它明确地将推理与感知解耦,即推理器决定要寻找什么,而专门的感知工具则回答它在哪里。具体来说,PixelEyes 引入了 1) 掩模引导的视觉搜索。调用参考分割模型来提供掩模精确定位,使推理器无需补偿不精确的视觉定位。 2)语义区域广度优先搜索(BFS)。为了消除因重复裁剪不正确的子区域而导致的冗余循环,我们将探索组织为对语义区域的广度优先搜索。为了内化这些功能,我们通过从现有数据重新合成专家轨迹来构建 PixelEyes-6K 数据集。这明确地将我们的掩码引导搜索和 BFS 逻辑嵌入到模型中。我们进一步引入了 Pinpoint-Bench,这是一种零提示视觉搜索基准,即问题中不提供位置提示,具有实例级掩码和边界框,可将定位失败与推理失败分开,从而能够对无意盲视等故障模式进行细粒度分析。最近最先进的 MLLM 和视觉推理代理在 Pinpoint-Bench 上留下了很大的空间,展示了它的质量和难度。代码和模型是开源的。