论文

感知、交互、推理:构建用于空间推理的工具增强视觉代理

Perceive, Interact, Reason: Building Tool-Augmented Visual Agents for Spatial Reasoning

模型训练强化学习

摘要

虽然最近的视觉语言模型(VLM)表现出强大的多模态理解能力,但它们在需要主动证据获取和多步骤视觉交互的空间推理任务中仍然受到限制。这种限制表明,仅依靠视觉编码器的隐式视觉表示不足以恢复细粒度的空间证据。我们引入了 PERception-Interaction-reason Agent (PERIA),这是一种工具增强的视觉代理,用于跨地图推理、视觉探测和视觉重建的空间推理任务。 PERIA 使用两个轻量级工具系列:用于揭示文本、符号和空间证据的视觉感知工具,以及用于操纵视觉上下文、追踪路径和验证空间关系的视觉交互工具。为了训练 PERIA,我们开发了一个统一的方案,结合了监督工具使用轨迹合成、复合奖励和观察宽松组中策略优化 (OR-GIGPO),以实现有效的多工具行为。对 8 个数据集的 13 个基准进行的实验表明,PERIA-8B 在分布内基准上比 Qwen3-8B 主干提高了 10.0%,在分布外基准上提高了 4.4%,同时比之前类似大小的最先进基准提高了 7.0%-14.8%。它还实现了与 Qwen3-VL-235B-A22B-Thinking 和 GPT-5 等更大的模型相当的性能,证明了 PERIA 在增强空间推理能力方面的有效性。