论文

通过时空先验和生成辅助的稀疏视图 4D 高斯泼溅

Sparse-View 4D Gaussian Splatting via Spatiotemporal Priors and Generative Assistance

应用与实践视觉感知与空间理解

摘要

我们为 SIGGRAPH Asia 2026 体积视频挑战赛的稀疏视图赛道提出了一个 4D 高斯泼溅框架,该框架仅需要六个具有宽基线的摄像机进行动态场景重建。为了在这种稀疏视图下实现鲁棒的动态重建,我们的框架集成了三个组件。 (1)区域自适应空间先验:我们使用前景掩模来指导高斯初始化和掩模投票来分别控制动态前景和静态背景的致密化。使用与公制比例对齐的单眼深度来规范背景几何形状。 (2) 运动一致的时间先验:我们通过帧插值在中间时间提供监督,并用估计的光流约束投影高斯运动。 (3) 生成辅助:我们将虚拟相机放置在最宽的角度间隙中,并使用基于相机姿势的基于扩散的模型来恢复其渲染图像。恢复的图像作为伪监督迭代地合并到训练中。在验证集上,我们的框架将全帧 PSNR 从基线的 25.60 dB 提高到 29.75 dB。在官方测试基准上,其全帧PSNR达到30.04dB,前景PSNR达到27.88dB,在Sparse-View Track中整体排名第一。

通过时空先验和生成辅助的稀疏视图 4D 高斯泼溅的原论文方法或结果图
图 1.我们的稀疏视图 4D 高斯泼溅流程概述。给定来自六个具有宽基线的摄像机的视频,我们的框架结合了三个组件:(1)区域自适应空间先验使用 YOLO11 和 SAM 2 掩模进行每帧前景初始化和致密化期间的掩模投票,以及用于背景深度正则化的 Depth Anything V2 预测; (2) 运动一致的时间先验使用 RIFE 插值来提供中间时间的监督,并使用 VideoFlow 估计来约束投影高斯运动; (3) 生成辅助使用 ArtiFixer 扩散模型 (de Lutio 等人,2026) 恢复从虚拟相机在宽角间隙中渲染的图像,并以相机姿势空间中最近的训练视图作为参考。恢复的图像作为伪监督迭代地合并到训练中,产生用于新颖视图合成的最终 4DGS 模型。从六个宽基线相机到 4D 高斯泼溅优化的管道。空间先验使用前景掩模和单眼深度,时间先验使用插值和光流,生成辅助在伪监督重新注入之前恢复虚拟视图。