论文

渲染到原因:新颖视图语义预测提高了VLM中的空间理解

Render to Reason: Novel-View Semantic Prediction Improves Spatial Understanding in VLMs

应用与实践视觉感知与空间理解

摘要

最近的工作利用预训练 3D 模型的几何特征增强了视觉语言模型,期望几何信号能够促进空间推理。然而,我们发现在标准空间 QA 上简单地融合几何特征和训练只能对高级多跳任务产生边际改进。我们将这种差距归因于训练信号问题:标准空间 QA 很大程度上可以从视觉特征和语言先验中得到答案,因此几何路径接收到较弱的梯度并且无法与视觉特征集成。为了提供需要几何形状的训练信号,我们提出 novel-view语义渲染 作为辅助训练任务,该任务要求模型预测未观察到的视点的语义布局,其灵感来自于人类在空间推理过程中在心理上模拟新视点的能力。该任务鼓励联合使用这两种途径:几何提供依赖姿势的可见性,而视觉提供语义内容。我们的辅助任务在所有三个基准上对几何增强基线产生了一致的改进(在 VSI-Bench 上高达 +1.6,在 ReVSI 上高达 +2.2,在我们的 3D-Point-QA 数据集上 +2.9),并且我们的完整模型超越了 VSI-Bench 和 ReVSI 上之前的开源方法。项目页面:https://yuqunw.github.io/Render2Reason/.

渲染到原因:新颖视图语义预测提高了VLM中的空间理解的原论文方法或结果图
图 2:模型架构。我们的模型共同支持语义小说视图渲染和标准 QA,共享骨干模型,仅提示和输出头不同。输入视图被编码为视觉和几何特征,通过交叉注意力融合,并传递到LLM解码器。对于新颖的视图语义渲染,我们通过几何编码器从目标视图中提取相机token并将其添加到提示符之前; LLM产生 256 个输出token,每个目标块按光栅顺序输出一个,每个通过 2 层 MLP 映射到语义类。对于标准 QA,提示仅包含问题,LLM生成答案而不使用渲染 MLP。