论文

ProSR:VLM 中可靠思想链的过程型空间推理

ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

模型训练强化学习

摘要

可靠的空间推理仍然是视觉语言模型(VLM)的核心瓶颈。现有的主流空间推理训练范式很大程度上依赖于结果对齐或过程模仿,缺乏对推理过程的明确约束,因此难以确保真正的视觉依赖性和稳定的推理轨迹。在本文中,我们构建了涵盖多种空间现象的高质量CoT数据集,并对模型的推理过程进行了诊断,揭示了强化学习优化过程中两种典型的过程退化类型:绕过视觉证据的虚假视觉证据关联和推理后期不确定性异常上升的尾部不稳定。为了解决这些问题,我们提出了 ProSR,一种用于空间推理的流程塑造优化框架。通过反事实不变性罚分和尾部漂移罚分,ProSR 将优化目标从单一答案正确性扩展到两个过程级维度:视觉依赖性和轨迹稳定性。对多个复杂且不分布的空间推理基准的实验表明,ProSR 提高了答案准确性,同时生成更稳定且更依赖于视觉证据的推理轨迹。