论文

新近度强迫:弥合自回归视频生成中的长期差距

Recency Forcing: Bridging the Long-Horizon Gap in Autoregressive Video Generation

模型架构Transformer

摘要

由于被忽视的训练推理差异(我们称之为 KV 逐出不匹配),自回归 (AR) 视频生成在长期范围内会退化:模型在所有上下文帧都驻留在 KV 缓存中的短剪辑上进行训练,但在推理时,内存限制会强制从 KV 缓存中逐出远处的帧 - 删除模型所依赖的上下文。我们不是通过上下文截断来模拟逐出(这会丢弃模型仍然需要的时间信息并降低运动连贯性),而是保留上下文,但同时逐渐减少远处帧的影响,使它们最终的逐出可以忽略不计。为了指导这一设计,我们引入了位置响应 $R( Δ, \, t_{\text{denoise}})$,这是一种基于扰动的灵敏度测量,揭示了上下文影响随着时间距离的变化而急剧衰减,并且在去噪步骤中系统地变化。受此分析的启发,我们提出了新近度强迫(Recency Forcing),它对直接从 $R$ 导出的 pre-softmax 注意力logits应用非正的、依赖于时间步长的偏差,称为时间响应偏差 (TRB),从而在不修改上下文长度或训练目标的情况下缩小训练推理差距。我们进一步引入了偏置注意力重新参数化(BAR),这是一种精确的重新表述,可将偏置移至 softmax 之外,使 TRB 成为零开销的标准 FlashAttention 调用。近因强迫可以在无训练模式和基于训练模式下运行。 VBench 和 VBench-Long 上的实验证明了最先进的长视野生成质量,且无需额外的推理成本。