论文
视频扩散模型可以预测过去的帧吗?可逆插值的双向循环一致性
Can Video Diffusion Models Predict Past Frames? Bidirectional Cycle Consistency for Reversible Interpolation
摘要
视频帧插值旨在合成给定端点之间的真实中间帧,同时遵循特定的运动语义。虽然最近的生成模型提高了视觉保真度,但它们主要以单向方式运行,缺乏自我验证时间一致性的机制。这通常会导致运动漂移、方向模糊和边界未对准,尤其是在长距离序列中。受自监督学习中时间周期一致性原理的启发,我们提出了一种新颖的双向框架,可以强制前向和后向生成轨迹之间的对称性。我们的方法引入了可学习的方向标记,以显式地调节时间方向上的共享主干,使模型能够在单个统一架构内联合优化前向合成和后向重建。这种循环一致的监督充当强大的正则化器,确保生成的运动路径在逻辑上是可逆的。此外,我们采用课程学习策略,从短序列到长序列逐步训练模型,从而稳定不同持续时间的动态。至关重要的是,我们的循环约束仅在训练期间应用;推理需要单次前向传递,保持基础模型的高效率。大量实验表明,我们的方法在 37 帧和 73 帧任务上的成像质量、运动平滑度和动态控制方面均实现了最先进的性能,优于强大的基线,同时不会产生额外的计算开销。