论文

Manifold4D:点云渲染流形上的去噪以用于视频重新拍摄

Manifold4D: Denoising on Point Cloud Rendered Manifolds for Video Re-shooting

应用与实践内容创作

摘要

视频重新拍摄沿着用户指定的相机轨迹重新渲染动态场景的单目视频,并且主要配方明确地提供目标几何形状:每帧深度将源视频提升到 4D 点云,该点云沿着轨迹光栅化为点云渲染。由于渲染和源视频都作为视觉条件传递给网络,因此它们在每个去噪步骤中都会竞争,从而使模型陷入信任困境(需要相信多少渲染),这可能会降低训练分布之外数据的轨迹控制或视觉质量。我们认为,已经与目标视图像素对齐的渲染根本不需要作为显式调节流提供。我们提出了 MANIFOLD4D,它将渲染直接注入到流匹配的初始噪声中,以便生成不再偏离标准高斯噪声,而是偏离携带几何信息的新噪声流形,使源视频成为唯一的视觉条件。因此,渲染只使用一次,并且网络不会被要求学习如何读取它;在后续的去噪步骤中,模型可以专注于源视频。在我们的 DAVIS-Traj 基准测试和 Vista4D 评估集上,MANIFOLD4D 在每个指标上都实现了最佳的相机控制精度,与最强基线相比,旋转误差降低了 25% 和 27%,平移误差降低了高达 32%,同时在视频保真度方面与之匹配,并在现实世界的新颖视图光度质量方面处于领先地位。在用户研究中,我们的方法在轨迹跟踪和动态一致性方面取得了明显的优势。随着偏航幅度超过训练范围,差距会扩大,并且当渲染被故意破坏时,模型仍然可以从源视频中恢复正确的动态运动,从而确认几何先验指导生成而不会覆盖它。