论文
从网络到像素:将代理搜索带入视觉感知
From Web to Pixels: Bringing Agentic Search into Visual Perception
摘要
视觉感知将高级语义理解与像素级感知联系起来,但大多数现有设置都假设识别目标的决定性证据已经存在于图像或冻结模型知识中。我们研究了一个更实际但更困难的开放世界案例,其中可见对象必须首先从外部事实、最近事件、长尾实体或多跳关系中解析出来,然后才能进行本地化。我们将这一挑战形式化为感知深度研究,并引入了 WebEye,这是一个对象锚定基准,具有可验证的证据、知识密集型查询、精确的框/掩模注释以及三个任务视图:基于搜索的基础、基于搜索的分割和基于搜索的 VQA。 WebEyes 包含 120 个图像、473 个带注释的对象实例、645 个独特的 QA 对和 1,927 个任务样本。我们进一步提出 Pixel-Searcher,这是一种代理搜索到像素的工作流程,可以解析隐藏的目标身份并将其绑定到框、掩码或视觉定位答案。实验表明,Pixel-Searcher 在所有三个任务视图中都实现了最强的开源性能,而失败主要来自证据获取、身份解析和视觉实例绑定。