论文

VideoWeave:通过联合几何-视频建模解锁视频生成中的几何一致性

VideoWeave: Unlocking Geometric Consistency in Video Generation via Joint Geometry-Video Modeling

模型训练预训练

摘要

随着时间的推移,大规模视频扩散模型通常无法保留 3D 结构,从而导致视点变化下的几何漂移和难以置信的运动。现有方法通常通过使用显式几何重建(例如深度图、点云或重建的 3D 结构)来定义条件、监督或奖励信号来强制几何一致性,从而使生成器对上游几何管道的错误敏感。我们提出了 VideoWeave,一个潜在空间 后训练 框架,它使用隐式几何模型特征来约束生成分布,提供更灵活和非刚性的指导形式,减轻几何模型重建误差的影响。具体来说,VideoWeave 将这些特征适应几何潜在特征,并在共享去噪空间中将它们与视频潜在特征联合建模,从而允许几何形状在训练期间塑造生成分布。为了支持这一过程,我们构建了 GeoVid-80K,这是一个具有配对外观和几何表示的 80K 视频数据集。文本到视频和图像到视频生成的实验表明,VideoWeave 提高了几何一致性,同时保持了强大的视觉质量。 VideoWeave 项目页面 https://videoweave.github.io/