论文
通过几何逻辑一致性进行视觉语言模型中的自进化空间推理
Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
摘要
视觉语言模型(VLM)已经取得了惊人的进步,但它们的空间推理仍然脆弱:正确回答原始输入的模型在具有可预测答案映射的配对转换下仍然可能失败,揭示了实例级正确性和鲁棒空间推理之间的差距。为了解决这个问题,我们提出了 Spatial Alignment via Geometric Evolution (SAGE),这是一种自我进化框架,通过几何和语言对偶操作来增强 VLM 中的逻辑一致性。 SAGE 将二元一致性作为 GRPO 训练中的辅助奖励,鼓励模型在原始输入和转换后的输入中生成逻辑上一致的答案。动态操作池不断探测不一致之处,促进具有挑战性的操作并淘汰已掌握的操作,以便训练重点关注信息最丰富的信号。与之前的 GRPO 方法相比,SAGE 与模型无关,数据效率高,并且可以作为轻量级 后训练 阶段应用于任何现有的 VLM。视频和空间推理基准的实验表明,在强基线上取得了一致的改进,并增强了对未见数据的泛化能力。