论文

通过 3D 基础先验实现真实且一致的轨道视频生成

Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors

应用与实践内容创作

摘要

我们提出了一种从物体的单个图像生成几何真实且一致的轨道视频的新颖方法。现有的视频生成工作主要依赖于像素级关注来强制跨帧的视图一致性。然而,这种机制并没有对远程外推施加足够的约束,例如后视合成,其中与输入图像的像素对应是有限的。因此,这些作品常常无法产生具有合理且连贯结构的结果。为了解决这个问题,我们建议利用 3D 基础生成模型中丰富的形状先验作为辅助约束,其动机是其对从大型 3D 资产语料库中学习的真实对象形状分布进行建模的能力。具体来说,我们使用 3D 基础模型编码的两种规模的潜在特征来促进视频生成:(i)作为整体结构指导的去噪全局潜在向量,以及(ii)从体积特征投影的一组潜在图像,以提供依赖于视图的细粒度几何细节。与常用的 2.5D 表示(例如深度图或法线图)相比,这些紧凑的特征可以对完整的对象形状进行建模,并通过避免显式网格提取来帮助提高推理效率。为了实现有效的形状调节,我们引入了多尺度 3D 适配器,通过交叉注意力将特征标记注入到基本视频模型中,这保留了一般视频预训练的功能,并实现了简单且模型对抗的 微调 过程。对多个基准的大量实验表明,与最先进的方法相比,我们的方法实现了卓越的视觉质量、形状真实性和多视图一致性,并且可以稳健地推广到复杂的相机轨迹和野外图像。