论文

TeDiO:无需训练 相干视频扩散的时间对角线优化

TeDiO: Temporal Diagonal Optimization for Training-Free Coherent Video Diffusion

应用与实践内容创作

摘要

最近的文本到视频扩散 Transformer 生成视觉上引人注目的帧,但仍然与时间连贯性作斗争,经常产生闪烁、漂移或不稳定的运动。我们表明,这些失败在模型中留下了清晰的印记:不连贯的视频在其中间自注意力图中始终表现出不规则、碎片化的时间对角线,而稳定的运动对应于平滑的带对角线模式。基于这一观察,我们引入了 TeDiO,一种 无需训练 推理时间方法,通过规范这些内部注意力模式来增强时间一致性。 TeDiO 估计对角线平滑度,识别不稳定区域,并执行轻量级潜在更新,以促进连贯的帧到帧动态,而无需修改模型权重或使用外部运动监督。在多种视频扩散模型(例如 Wan2.1、CogVideoX)中,TeDiO 提供明显更平滑的运动,同时保持每帧视觉质量,提供高效的即插即用方法来提高现代视频生成系统的动态真实感。