论文

像鸽子一样主动探索:通过代理视觉语言模型强化空间推理

Active Exploring like a Pigeon: Reinforcing Spatial Reasoning via Agentic Vision-Language Models

模型训练强化学习

摘要

让视觉语言模型 (VLM) 执行空间推理仍然具有挑战性。现有方法将 VLM 视为被动观察者,这对于实际应用来说很困难。此外,强化学习方法依赖于稀疏奖励,限制了其复杂推理任务的有效性。受鸽子构建和利用认知地图进行导航的启发,我们提出了一种新颖的空间推理代理管道。首先,我们引入一个新的\emph{动态认知图},将场景布局参数化为对象位置和方向,作为新观察的持久记忆。其次,我们提出了一种新颖的 \emph{空间断言代码(SAC)},即以编程方式描述空间关系的 Python 表达式。通过与动态认知图协作,SAC 可以验证中间推理步骤,提供密集的奖励信号。我们通过监督和强化微调来优化模型。 MindCube 基准测试的实验展示了最先进的性能,总体精度为 \emph{80.5\%},在具有挑战性的 \textsc{Rotation} 子集上,比当前最好的方法高出 \emph{29.5} 精度点(相对改进 \emph{53.2\%})。我们的代码和数据在 https://github.com/dw-dengwei/active-spatial-reasoning.git 上开源。