论文
通过层自适应 O.O.D 校正轻松生成长视频
Free-Lunch Long Video Generation via Layer-Adaptive O.O.D Correction
摘要
使用预先训练的视频扩散模型(通常在短片上进行训练)生成长视频提出了重大挑战。直接应用这些模型进行长视频推理通常会导致视觉质量显着下降。本文指出,这个问题主要源于两个分布外(O.O.D)问题:帧级相对位置 O.O.D 和上下文长度 O.O.D。为了应对这些挑战,我们提出了 FreeLOC,一种新颖的 无需训练 层自适应框架,它引入了两种核心技术:用于帧级相对位置 O.O.D 的基于视频的相对位置重新编码(VRPR),一种对时间相对位置进行分层重新编码以与模型的预训练分布对齐的多粒度策略,以及用于上下文长度 O.O.D 的分层稀疏注意力(TSA),它保留了通过在不同时间尺度上构建注意力密度来实现局部细节和远程依赖性。至关重要的是,我们引入了一种层自适应探测机制,该机制可识别每个 Transformer 层对这些 O.O.D 问题的敏感性,从而允许选择性且高效地应用我们的方法。大量实验表明,我们的方法明显优于现有的 无需训练 方法,在时间一致性和视觉质量方面均取得了最先进的结果。代码可在 https://github.com/Westlake-AGI-Lab/FreeLOC 获取。