论文

视频传播模型中的序列性差距

The Seriality Gap in Video Diffusion Models

模型评测模型行为与机制分析

摘要

当一个球击中另一个球,然后击中另一个球时,视频模型应该预测每次弹跳的后果。在多球硬球动力学的受控实验中,我们发现,即使提供更多的降噪步骤,标准双向视频扩散的性能也会随着因果链的延长而降低。在长度匹配的单球控制中,不存在球与球之间的相互作用,退化很大程度上消失,隔离相关事件结构而不是视频长度作为原因。在干预研究中,增加有效串行计算的方法极大地提高了性能,包括自回归/分块生成和架构深度。我们将这种模式识别为串行差距:需要不断增长的串行计算的任务与去噪循环不提供可扩展串行计算的视频扩散模型之间的不匹配。然后我们证明,对于确定性视频预测,去噪步骤不会在主干之外添加串行计算,这表明视频扩散在串行推理和模拟任务上存在结构性障碍。