论文
SVoT:经强化学习的状态感知思维可视化用于空间推理
SVoT: State-aware Visualization-of-Thought for Spatial Reasoning via Reinforcement Learning
摘要
空间推理仍然是多模态大型语言模型 (MLLM) 的一个挑战,因为它需要对中间状态和状态转换进行可靠的多跳推理。当前的研究经常未验证中间状态,并将状态转换视为隐式过程,这限制了多跳空间推理的可靠性。为了解决这个问题,我们提出了状态感知可视化思想(SVoT),这是一种强化学习框架,可以生成交错的、可验证的中间状态和可视化。 SVoT 将转换推理链集成到生成过程中,使模型能够通过交错的文本和视觉推理来验证动作前提条件和效果。我们通过组相对策略优化(GRPO)来训练SVoT,通过奖励设计实例化验证并评估不同细粒度奖励的效果。由于现有基准将状态转换减少为单变量更新,从而大大简化了问题,因此我们通过扩展经典环境并引入两个需要多对象交互和数值推理的新颖域(Pacman 和 Gather)来建立五个域。这些领域支持多跳空间推理的系统评估,并定量验证生成的中间状态和转换推理。具有转换感知监督功能的 SVoT 在所引入的领域中实现了最先进的性能,在分布外测试集上获得高达 65% 的绝对准确度增益。
