论文

SATURN:多视角定位的符号空间推理

SATURN: Symbolic Spatial Reasoning for Multi-Perspective Grounding

模型推理推理策略与问题分解

摘要

当空间推理需要构建其含义取决于参考系的关系时,视觉语言模型 (VLM) 仍然不可靠。现有的工具增强空间推理方法使推理更加明确,但通常依赖于底层几何过程和针对噪声感知的硬二元决策。我们提出了 SATURN,一种用于透视感知组合空间推理的神经符号框架。 SATURN 重建近似 3D 场景,导出软透视感知空间谓词,并使用 无需训练 Python 符号执行器组合它们,将感知与推理分开,同时通过多跳推理保留不确定性。我们还引入了 3D FORCE,这是一种诊断基准,可控制空间排列定位 (SAG) 和指代表达定位 (REF) 的推理深度、视图和透视构图。在 3D FORCE 上,VLM 和空间训练模型随着深度和透视复杂性的增加而急剧退化,而 SATURN 的退化最小,并且在每个深度上都优于每个基线。在现实世界的 MindCube 基准测试中,SATURN 的整体准确率达到了 \(78.06\%\),比最强的基线高出 \(14\) 个百分点。