论文

SCOUT:通过结构化思维链和多目标过程奖励解锁增强的空间推理

SCOUT: Unlocking Enhanced Spatial Reasoning via Structured Chain-of-Thought and Multi-Objective Process Reward

模型训练强化学习

摘要

现有的视觉语言模型(VLM)在稳健的空间推理方面存在关键瓶颈。最近的强化学习(RL)方法旨在通过可验证的结果来缩小这一差距,但它们在中间推理步骤中的信用分配较差。同时,结构化推理方法忽视了全面 3D 理解所需的关键深度感知。为了应对这些挑战,我们提出了 SCOUT(利用过程监督的 RL 训练的结构化思想链)。具体来说,我们设计了一个结构化的思想链 (CoT) 框架,该框架显式地模拟 3D 环境感知,以确保强大的空间理解和推理。此外,我们引入了一种新颖的强化学习算法,具有多目标过程奖励和定制的优势估计方法,有助于在推理轨迹的不同部分进行细粒度的信用分配。为了支持我们的框架,我们开发了 SCOUT-24k,这是一个通过定制管道合成的结构化空间推理 CoT 数据集。广泛的评估表明,SCOUT-3B 在一般空间基准和复杂空间推理任务上分别比基线模型提高了 16.85% 和 6.3%。值得注意的是,我们更大的 SCOUT-7B 甚至比 GPT-4o 的性能高出 4.28%。此外,尽管专门针对单图像进行训练,SCOUT-7B 仍对多图像和视频场景表现出强大的域外泛化能力。这些实证结果表明 SCOUT 是迈向下一代空间感知 VLM 的关键一步。