论文
渲染到原因:新颖视图语义预测提高了VLM中的空间理解
Render to Reason: Novel-View Semantic Prediction Improves Spatial Understanding in VLMs
摘要
最近的工作利用预训练 3D 模型的几何特征增强了视觉语言模型,期望几何信号能够促进空间推理。然而,我们发现在标准空间 QA 上简单地融合几何特征和训练只能对高级多跳任务产生边际改进。我们将这种差距归因于训练信号问题:标准空间 QA 很大程度上可以从视觉特征和语言先验中得到答案,因此几何路径接收到较弱的梯度并且无法与视觉特征集成。为了提供需要几何形状的训练信号,我们提出 novel-view语义渲染 作为辅助训练任务,该任务要求模型预测未观察到的视点的语义布局,其灵感来自于人类在空间推理过程中在心理上模拟新视点的能力。该任务鼓励联合使用这两种途径:几何提供依赖姿势的可见性,而视觉提供语义内容。我们的辅助任务在所有三个基准上对几何增强基线产生了一致的改进(在 VSI-Bench 上高达 +1.6,在 ReVSI 上高达 +2.2,在我们的 3D-Point-QA 数据集上 +2.9),并且我们的完整模型超越了 VSI-Bench 和 ReVSI 上之前的开源方法。项目页面:https://yuqunw.github.io/Render2Reason/.
