论文
Video-Mirai:自回归视频扩散模型需要远见
Video-Mirai: Autoregressive Video Diffusion Models Need Foresight
摘要
因果视频生成器必须根据过去进行预测,但它们不需要仅从中学习。在流式自回归视频扩散中,每个发出的片段都成为未来片段必须保留的承诺。然而,标准训练只要求每个因果状态解释当前。这造成了我们所说的表示级规划差距:适合当前细分的状态可能会放弃一致的未来所需的身份、布局和运动信息。我们引入了 Video-Mirai,这是一种仅训练的方法,可以在不改变因果推理的情况下缩小这一差距:生成器按因果方式执行轨迹,冻结的前视编码器以非因果方式读取完成的执行轨迹,轻量级预测器将所得的停止梯度目标提炼为因果状态。未来的框架监督表示,而不是生成器输入。在推理时,编码器和预测器被丢弃,原始架构、每步 FLOP 和 KV 缓存行为保持不变。 Video-Mirai 将 5 秒 VBench 上的因果强迫基线总得分从 83.8 提高到 84.6。在超出训练范围的 30 秒执行轨迹中,主体一致性从 84.9 提高到 88.5,背景一致性从 90.2 提高到 91.9。消融将未来条件目标确定为关键成分,并且探测表明未来的帧变得更容易从当前的特征中解码。因果关系应该限制推理,而不是表征监督。我们的研究强调视觉自回归模型需要远见。项目页面:https://y0uroy.github.io/Video-Mirai。