论文
通过视频表示正则化减轻复合误差
Mitigating Compounding Error via Video Representation Regularization
摘要
基于视频扩散的世界模型可以为机器人、自动驾驶和模拟任务生成长时间的自回归视频,但滑动窗口自回归推理会遭受严重的错误积累,随着时间的推移会降低帧质量。尽管这种现象已被广泛观察到,但复合误差的根本机制以及如何实现稳定的长时程生成仍然在很大程度上尚未解决。在本文中,我们研究了视频世界模型的内部表示动态,发现复合误差与隐藏表示的维度崩溃紧密耦合。具体来说,模型表示的有效秩在生成漂移开始时急剧下降,揭示了表示退化与长程生成轨迹不稳定之间的密切联系。此外,我们发现纯训练数据缩放无法提高模型对误差漂移的抵抗力,这与主流缩放范例相矛盾。为了解决这个问题,我们提出了视频表示正则化,这是一种轻量级训练约束,可以稳定潜在表示并抑制迭代错误累积。与扩散强迫相比,我们的方法在 VBench 的美学质量和成像质量指标上实现了从 38.65 到 55.56 以及从 44.37 到 72.08 的改进。我们的工作在自回归视频漂移和模型内部表示之间建立了第一个联系,采用 erank 作为误差累积的定量指标,揭示了视频世界模型违反直觉的缩放限制,并提出了一种简单而有效的正则化策略来提高长视频生成的鲁棒性。