论文
EviRover:增强 Agentic 的感知能力
EviRover: Reinforcing Agentic Perception Beyond a Glance
摘要
视觉感知通常被表述为在图像内容和模型的参数知识足以解决查询的假设下,对图像进行一次预测。在依赖于细粒度视觉细节或需要知识密集型和最新信息的现实场景中,这种假设通常会失败。我们将这种情况称为 证据不足下的感知,并将感知表述为一个 Agentic 过程,该过程可以获得超出一眼的信息。为了解决此设置中缺乏数据的问题,我们设计了两个专用数据生成管道,生成用于训练的 EviRover-SFT-5K 和 EviRover-RL-12K。我们进一步构建了 EviLens,这是一个经过人类验证的基准,包含五个感知类别的 688 个实例。基于这些数据,我们提出了 EviRover,据我们所知,这是第一个经过明确训练以通过交互解决感知查询的感知Agent,使用监督微调,然后进行 Agentic 强化学习。实验表明,4B EviRover 在 EviLens 上的性能平均比骨干网高出 30 个点,达到了与先进专有型号相当的性能。收益从 EviLens 转移到 WebEyes、传统感知基准和通用多模态基准,包括在 BrowseComp-VL 上提高 15 个百分点。所有代码、模型和数据均已发布。