论文
为什么视频扩散模型违反物理原理?揭示注意力机制的缺陷
Why Do Video Diffusion Models Violate Physics? Unveiling the Flaws in Attention Mechanisms
摘要
尽管视觉质量令人印象深刻,但最先进的视频扩散模型经常生成违反现实世界物理定律的内容。虽然现有的解决方案依赖于外部先验或专门数据,但我们通过探索这些模型的内部机制来调查根本原因。具体来说,我们提出了第一个关于文本到视频扩散模型的“运动规划”过程的可解释性研究,揭示了运动轨迹在早期去噪阶段是如何形成的。基于“先是形状,然后是细节”的发现,我们将交叉注意力轨迹模式与因果头贡献相结合,以确定驱动运动规划的注意力头的特定子集。此外,我们的自注意力分析表明,旋转位置嵌入(RoPE)会导致过度的空间注意力衰减。这会导致早期候选区域过早锁定到物理上不合理的位置,抑制相邻帧中的合理轨迹并触发生成故障模式。为了解决这个根本缺陷,我们提出了一种轻量级的架构修改,可以跨不同的去噪步骤缩放 RoPE 的频率。这种策略减少了过度的注意力衰减,帮助模型探索更好的候选区域以建立连贯的物理运动。最后,免训练和基于训练的实验证实了我们的方法在增强生成视频的物理常识方面的有效性。