论文

OrientSAM:经朝向感知空间对齐缓解多模态空间推理的相机中心捷径

OrientSAM: Mitigating Camera-Centric Shortcut in Multimodal Spatial Reasoning via Orientation-Aware Spatial Alignment

模型架构新型架构

摘要

多模态大语言模型(MLLM)仍在需要视角转换的空间推理上挣扎:它们常依赖相机中心线索、而非从参考物体的视点推理,在非相机参考设定下导致系统性错误。本文首先分析这一失败模式,证明物体朝向是相机中心捷径行为的关键因素。为解决该问题,我们提出OrientSAM,一个面向多模态模型的朝向感知空间对齐框架:OrientSAM经朝向感知token与基于傅里叶的角度编码把显式朝向信息注入多模态表示,并采用课程学习策略渐进提升视角感知推理;同时构建空间数据构造管线,从大规模图像生成朝向感知的空间监督。在Spatial-MM、ViewSpatial与3DSRBench上的实验显示,OrientSAM持续优于强基线,尤其在非相机视角、以人为中心与朝向敏感任务上。结果进一步证明显式朝向建模对缓解相机中心捷径、实现更稳健的他者中心空间推理的重要性。

OrientSAM:经朝向感知空间对齐缓解多模态空间推理的相机中心捷径:论文配图
图 1:代表性案例研究。现有模型偏向相机平面线索,无法在参考对象的局部视点下进行推理,而 OrientSAM 通过结合参考对象的方向正确预测空间关系。