论文

重新思考 3D 噪声:通过无优化形态扰动学习 3D 感知视频先验

Rethinking 3D Noise: Learning 3D-Aware Video Priors via Optimization-Free Morphological Perturbations

模型训练合成数据

摘要

NeRF 和 3D Gaussian Splatting (3DGS) 等 3D 场景表示在稀疏视图设置中会出现严重的伪影。最近的生成 3D 工件修复器试图解决这个问题,但依赖于成对的损坏和干净的渲染,需要跨不同视图配置进行昂贵的按场景重建。虽然 2D 图像增强充当即时正则化器,但 3D 表示不存在明确的等效项来保持视图之间的空间一致性,这是 3D 感知训练的基本属性。我们提出 3D 形态扰动作为一种无需优化的正则化器,可以保持空间一致性。利用显式 3DGS,我们将每个高斯视为基本构建块(类似于 2D 像素),并通过缩放、旋转和修剪在其形态参数空间上应用扰动。我们的方法消除了数据集管理中的每个场景 3DGS 优化循环,同时使模型能够在轻量级视频扩散沙箱上进行的诊断消融中学习比稀疏视图基线更强的几何先验。通过 ControlNet 扩展到 14B 参数视频模型,我们的方法在保持视觉保真度的同时,与最先进的图像到图像 3D 伪影细化器相比,平均深度误差降低了 12.5%,最终将下游机器人策略在 4 个操作任务中的 3 个中的成功率提高了 8.0%。