论文
SIFT:视频扩散模型中物理合理运动的自我想象 微调
SIFT: Self-Imagination Fine-Tuning for Physically Plausible Motion in Video Diffusion Models
摘要
视频扩散模型的最新进展极大地提高了视觉保真度,但它们生成的运动常常违反物理合理性。我们观察到一种常见的运动学故障,即“运动纠缠”,即独立运动源(例如相机运动和物体运动)的意外耦合。我们发现这个问题源于数据偏差和扩散模型的基于重建的训练设计。对仍然保留粗略运动线索的嘈杂视频进行训练会无意中鼓励模型复制现有运动,而没有动力去学习如何对基于运动学的运动进行建模。为了解决这个问题,我们提出了一种自我想象 微调 (SIFT) 范例,该范例使模型能够从自己生成的视频中学习,而不是直接重建真实视频,从而打破了重建捷径。我们进一步采用运动感知判别监督和渐进式硬案例重放策略来稳定和加速学习。通过利用自由生成的文本提示,我们的方法可以密集覆盖广阔的运动空间,包括罕见或精细分离的场景,而这些场景作为视频数据收集起来成本高昂。大量的实验表明,我们的方法大大提高了生成视频的物理真实感、运动解缠结和可控性。