论文
追问的艺术:一致性放大空间推理中的事实性
The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning
摘要
当前的大型推理模型(LRM)表现出卓越的通用能力,但在空间推理任务中表现明显不佳。现有方法将这种差距视为知识缺陷,依靠监督微调(SFT)从外部视觉源或合成引擎获取标记的空间数据。相比之下,我们认为,对于许多任务,空间推理能力已经存在于预先训练的 LRM 中,但需要在几何 2D 和 3D 约束下通过逻辑一致性进行对齐。在这项工作中,我们提出了一种自监督强化学习(RL)框架,该框架针对内部推理过程,而不需要真实注释。通过形式化一致性验证器的概念(检查变换下几何和语义一致性的奖励函数),我们证明模型可以提高其空间推理能力。我们使用图像变换(如翻转)和文本变换(如交换问题中对象的顺序),并提出了一种新的基于传输的最优 RL 策略 OT-GRPO,它是为成对验证者量身定制的组相对策略优化的最小匹配变体。我们证明,这种无标签一致性训练接近于经过真实监督训练的模型的准确性,并在不同的任务和数据域中实现了类似的泛化。
