论文
视觉并行搜索:学习使用并行平铺检查和自适应缩放来搜索高分辨率图像
Visual Parallel Search: Learning to Search High-Resolution Images with Parallel Tile Inspection and Adaptive Zoom
摘要
高分辨率视觉问答通常会失败,因为多模态模型无法获取回答问题所需的小型空间局部证据。顺序缩放可以恢复细节,但它要求主模型在获得可靠的概览之前选择一个区域。我们引入了 VPS,一种视觉并行搜索框架,其中主Agent首先调用 grid_search 与问题条件子Agent并行检查图像图块,然后在精确或合并区域上自适应调用 Zoom_in。相同的接口支持主Agent和子Agent的免训练推理和后训练。在五个基准分割和三个模型大小中,VPS 在 15 个相同模型比较中的 14 个中比专用的仅缩放搜索提高了平均准确度,增益高达 8.0 个点,对于较小的主模型尤其有显着的改进。 ZoomBench 在每个测试尺寸下都保留了大约 3.2 点的增益。我们进一步开发了一个具有无提示验证的监督管道和一个配对的特定于角色的 GRPO Agent,用于学习控制器和图块读取器角色。 SFT 提高了所有五个基准分割的观察精度,包括在 HR-Bench 4K 上提高了 4.17 点。特定于角色的 RL 进一步重塑搜索行为:仅主要 RL 将平均工具使用率从 2.65 减少到 2.11,在内部四响应评估中具有类似的 pass@1,而外部准确性变化是混合的。联合训练揭示了局部证据读取和全局搜索控制之间的不对称。总之,这些结果支持 VPS 作为有效的推理时间支架和视觉证据获取的可训练分解。