论文

MM-TRELLIS:自动驾驶中点云引导的多模态 3D 车辆生成

MM-TRELLIS: Point-Cloud Guided Multi-Modal 3D Vehicle Generation in Autonomous Driving

模型推理解码与生成控制

摘要

从自动驾驶场景中恢复真实的 3D 车辆模型对于合成训练数据和构建模拟环境至关重要。然而,大多数现有的车辆生成方法无法充分利用多模态传感器(即多视图图像和激光雷达点云),并且依赖于基于神经渲染的重建,导致网格质量低下。最近,原生 3D 生成模型取得了重大进展,但它们并不是为任意多视图输入而构建的,并且经常难以处理野外驾驶图像。在这项工作中,我们提出了 MM-TRELLIS,这是一种用于野外 3D 车辆生成的 TRELLIS 多模态版本,它将来自自动驾驶数据集的 LiDAR 和图像传感器集成到原生 3D 生成模型中。具体来说,多视图图像循环作为条件输入,而 LiDAR 点云提供测试时指导,以确保几何精度和跨视图一致性。在去噪过程中,我们首先将引导点云与模型先验对齐,然后强制生成的几何图形和引导点云之间的一致性。最后,我们引入了一种基于 3D 高斯泼溅不透明度的体素过滤策略,以抑制漂浮物并生成干净的网格。 Waymo 数据集上的综合实验表明,我们的方法在高保真 3D 车辆生成方面优于现有方法。代码可在 https://github.com/hongliXiao/MM-TRELLIS 获取。