论文

M3GD:相机的多模态多视图几何扩散--LiDAR新视图合成

M3GD: Multi-Modal Multi-View Geometric Diffusion for Camera--LiDAR Novel View Synthesis

应用与实践内容创作

摘要

机器人新颖视图合成 (NVS) 必须恢复视觉外观和度量 3D 结构,但大多数生成式 NVS 方法仅依赖于图像,而忽略了机器人平台上常见的补充传感器 LiDAR。我们提出了 M3GD,一种用于生成 NVS 的相机-LiDAR 多模态表示,它组成独立预训练的 2D 图像和 3D 点云基础模型,无需单独预训练跨模态转换器。我们表明,在相机投影之后,冻结的激光雷达和图像特征表现出大量共享的空间结构,提供了自然的跨模式表示。 M3GD 通过这种结构在 LiDAR 上生成条件:它将显式几何统计数据与学习的点云描述符结合到图像潜在网格上的视图对齐数据包中,通过轻量级残差适配器注入到多视图流匹配生成器中,其潜在空间、解码器和训练目标保持不变。在 GrandTour 数据集上,M3GD 比同一主干网的纯图像版本改进了目标视图 RGB 和深度合成。消融显示增益来自像素对齐的 LiDAR 内容,并且目标视图 LiDAR 充当将请求的视图与源观测链接起来的几何查询。在地面机器人上的部署展示了实际的实际操作,具有由欧拉积分步骤数量控制的可配置质量-成本权衡。