论文
Scene-SAM3D:无需 微调 的多视图场景资产生成
Scene-SAM3D: Multi-View Scene Asset Generation Without Fine-Tuning
摘要
高质量 3D 场景资产对于机器人操作、导航和模拟等具体应用至关重要。尽管具有强大的对象先验,但最近的单图像 3D 生成模型(例如 SAM3D)仍然不足以满足现实世界的场景,其中严重的遮挡、冗余观察和跨视图不一致使得可靠的场景生成具有挑战性。我们介绍 Scene-SAM3D,这是一个 无需训练 框架,它将 SAM3D 从单视图对象生成扩展到校准的多视图场景资产生成。 Scene-SAM3D 选择一组紧凑的互补视图,减少观察冗余,同时为各个视图中遮挡的区域提供额外的证据。基于选定的视图,它执行步进有效的潜速度融合,以集成多视图证据并抑制规范空间中的跨视图冲突。最后,轻量级刚性对象高斯优化在 200 次迭代内细化场景布局,同时保留生成的对象几何形状。 Replica 和 ScanNet++ 上的实验证明了实例和场景级别上的一致改进,我们的方法在 Replica 上将场景级 CD 减少了 43.8%,在 ScanNet++ 上减少了 30.9%,同时在相同的多视图设置下将流模型采样 FLOP 和 wall-time 延迟减少了近 20%。代码将在 https://github.com/xibi777/Scene-SAM3D 发布。