论文

从跨视图关系学习多视图空间推理

Learning Multi-View Spatial Reasoning from Cross-View Relations

模型训练合成数据

摘要

视觉语言模型 (VLM) 在单视图视觉任务上取得了令人印象深刻的结果,但缺乏具身AI系统理解 3D 环境和跨不同视点操纵对象所必需的多视图空间推理能力。在这项工作中,我们引入了跨视图关系(XVR),这是一个大型数据集,旨在教授 VLM 跨多个视图的空间推理。 XVR 包含源自 18K 不同 3D 场景和 70K 机器人操作轨迹的 100K 视觉-问题-答案样本,涵盖三个基本空间推理任务:对应(跨视图匹配对象)、验证(验证空间关系)和定位(识别对象位置)。在 XVR 上进行微调的 VLM 在已建立的多视图和机器人空间推理基准(MindCube 和 RoboSpatial)上实现了显着改进。当作为视觉-语言-动作模型的骨干集成时,XVR 训练的表示可以提高 RoboCasa 的成功率。我们的结果表明,对跨视图空间关系的显式训练可以显着增强多视图推理并有效地转移到现实世界的机器人操作。