论文

SpatialImaginer:迈向空间推理的自适应视觉想象力

SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning

模型推理推理策略与问题分解

摘要

空间智能是指从视觉观察中推理几何和物理结构的能力,仍然是多模态 大语言模型 的核心挑战。尽管性能很有前景,但最近的多模态 大语言模型 (MLLM) 在涉及一致空间状态识别的空间智能任务中经常表现出脆弱的推理痕迹。我们认为这些失败源于这些 MLLM 的空间识别机制和纯文本推理行为之间的不匹配。有效的空间推理需要在整个推理过程中忠实地保留和更新底层几何结构,而文本表示往往会精确地抽象出这些关键细节。为了解决这个问题,我们提出了 SpatialImaginer,一个统一的多模态生成框架,它将文本推理与视觉想象相结合。我们的框架采用分而治之的策略,使用文本思想链进行高级语义规划,使用视觉想象力进行几何敏感的状态转换和一致性保持。为了支持这种能力,我们进一步引入了具有闭环验证的难度感知数据引擎,以训练模型在需要稳定的空间状态跟踪时选择性地调用视觉想象力。对各种空间智能基准的大量实验表明,SpatialImaginer 实现了最先进的性能,并显着提高了复杂的多步骤空间推理任务的鲁棒性。