论文

GeoFlow:在视频生成中强制执行隐式几何一致性

GeoFlow: Enforcing Implicit Geometric Consistency in Video Generation

模型训练强化学习

摘要

生成几何一致的视频仍然是一个开放的挑战:在网络规模数据上训练的文本到视频扩散模型仅隐式地处理几何形状,导致对象变形、纹理漂移和相机运动下的非刚性背景。现有的解决方案要么作为副产品提高一致性,仅适用于静态场景,要么完全重新调整模型的潜在空间。我们引入了一种几何一致性奖励,可以直接测量生成视频中的运动是否与连贯场景兼容。我们的主要见解是,在物理一致的视频中,背景运动应该可以通过刚性相机引起的流动来解释,而独立移动的物体应该沿着运动轨迹保持外观同一性。我们使用光流、深度姿态预测和基于特征的对应来实现这一点,以分离刚性和动态区域并评估它们各自的一致性。将此奖励与强化 微调 相结合,将几何一致性从新兴属性转变为视频生成器的明确优化目标。该方法与模型无关,适用于包含相机和物体运动的各种动态场景。实验表明,与强基线相比,时间几何伪影大幅减少,同时保持了感知质量。代码和模型权重已发布。