论文
用于开放词汇 3D 场景理解的动态鲁棒光度语义重建
Dynamic-Robust Photometric-Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding
摘要
新颖视图合成 (NVS) 和开放词汇分割 (OVS) 的集成最近产生了强大的前馈 3D 基础模型。然而,它们对静态场景假设的固有依赖导致在不受约束的动态环境中空间特征的严重错位。为了弥补这一关键差距,我们提出了 SPAR,一种新颖的联合语义几何编码架构,它在潜在空间聚合之前明确隔离瞬态动态噪声。此外,我们引入了一种动态区域感知的端到端训练范例,该范例在结构上将运动估计与多视图视觉和语义学习结合起来。这种统一的方法使网络能够从本质上解决运动冲突,并从动态输入中提取多视图一致、时间稳定的场景表示。在具有挑战性的 D-RE10K 基准测试上进行的大量实验表明,SPAR 实现了最先进的性能。我们的端到端方法实现了卓越的新颖视图合成质量,在仅提供 3 个和 4 个输入视图的情况下分别产生 22.15 dB 和 23.33 dB 的 PSNR。尽管以自我监督的方式进行训练,我们的模型在运动掩模预测方面仍达到了 88.5% 的 mIoU。此外,我们的分析揭示了光度场景重建和语义理解之间强大的任务间协同作用,其中语义合成学习始终增强新颖视图渲染中的光度保真度。代码可在 https://github.com/dmucby/SPAR 获取。