论文

追问的艺术:一致性放大空间推理中的事实性

The Art of Interrogation: Consistency Amplifies Factuality in Spatial Reasoning

模型训练强化学习RLVR

摘要

当前的大型推理模型(LRM)表现出卓越的通用能力,但在空间推理任务中表现明显不佳。现有方法将这种差距视为知识缺陷,依靠监督微调(SFT)从外部视觉源或合成引擎获取标记的空间数据。相比之下,我们认为,对于许多任务,空间推理能力已经存在于预先训练的 LRM 中,但需要在几何 2D 和 3D 约束下通过逻辑一致性进行对齐。在这项工作中,我们提出了一种自监督强化学习(RL)框架,该框架针对内部推理过程,而不需要真实注释。通过形式化一致性验证器的概念(检查变换下几何和语义一致性的奖励函数),我们证明模型可以提高其空间推理能力。我们使用图像变换(如翻转)和文本变换(如交换问题中对象的顺序),并提出了一种新的基于传输的最优 RL 策略 OT-GRPO,它是为成对验证者量身定制的组相对策略优化的最小匹配变体。我们证明,这种无标签一致性训练接近于经过真实监督训练的模型的准确性,并在不同的任务和数据域中实现了类似的泛化。

追问的艺术:一致性放大空间推理中的事实性:论文配图
图 1:一致性验证器示例。给定询问对象 A 是否位于对象 B 左侧的提示,我们应用变换(图像上的水平翻转、问题的重新表述)来创建增强提示。一致性验证器检查模型的答案是否满足预期的关系(这里是不一致),而不需要真实标签。例如,如果模型在原始提示上回答 True,在增强提示上回答 False,则考虑到变换,无论实际空间排列如何,答案都是一致的。