论文
强化空间视觉语言模型中的双路径推理
Reinforcing Dual-Path Reasoning in Spatial Vision Language Models
摘要
空间 VLM 在几何感知方面取得了实质性进展,但需要对深度、距离和场景关系进行多步推理的复杂空间推理仍然具有挑战性。此外,不同的空间查询需要根本不同的策略:有些最好通过纯粹的语言、逐步演绎来解决,而另一些则需要在定量推理之前明确的三维定位。我们提出了通过强化学习进行空间 VLM 的双路径空间推理 (SR-REAL),这是一个统一的框架,为空间 VLM 配备了两个互补的推理路径:仅语言推理 (LOR),它执行逐步的语言演绎;以及检测然后推理 (DTR),它在显式几何推理之前通过区域标记检测 3D 几何线索(例如,中心或边界框)。 SR-REAL 从冷启动监督 微调 阶段开始,构建 LOR 和 DTR 思想链监督并公开区域到 3D 接口,然后是 RL,以准确性和格式奖励优化策略模型;对于 DTR,基于离散中心的检测奖励进一步细化了几何对齐。在不同的空间基准中,SR-REAL 显着优于空间 VLM 基线:(i)单个 RL 训练模型支持两种推理路径,DTR 通过精确的 3D 定位和 LOR 增强一般空间推理,在区域感知任务中表现出色; (ii) 联合训练两条路径可以促进相互促进; (iii) 高质量、混合的冷启动数据对于稳定的强化学习优化至关重要; (iv) 该模型可以跨数据集和领域进行推广,无需针对每个任务进行调整,证明了 LOR 和 DTR 之间的正迁移。