论文

AtlasVid:通过解耦的全局局部建模高效生成超高分辨率长视频

AtlasVid: Efficient Ultra-High-Resolution Long Video Generation via Decoupled Global-Local Modeling

模型架构Transformer

摘要

最近基于扩散的视频生成器已经实现了卓越的视觉保真度和即时可控性,但将其缩放为超高分辨率(UHR)长视频仍然非常昂贵。对于长单镜头生成来说,这一困难尤其明显,其中连续场景必须保持全局时间连贯性和细粒度空间细节,而不依赖于剪辑过渡或自回归镜头拼接。在这项工作中,我们从解耦建模的角度重新审视这一挑战。我们认为现有的视频扩散模型已经编码了强大的局部视觉先验,而主要瓶颈在于随着分辨率和持续时间的增加而有效扩展全局时空建模。基于这一见解,我们提出了 AtlaVid,一种用于高效 UHR 长视频生成的解耦的全局本地框架。 AtlaVid 首先通过时间缩放的 RoPE 生成低分辨率和低 FPS 的全局语义代理,从而在不增加训练标记数量的情况下扩展时间范围。在此代理的指导下,高分辨率细节分支通过分层局部性保留注意力执行联合去噪。重新排序的时空窗口保留了几何局部性,不对称的全局局部注意力注入了对齐的语义指导并保留了模型的预训练能力。这种设计支持与分辨率无关的训练:该模型仅在 720P 下进行训练,并采用轻量级 LoRA 适配,但可以直接推广到 4K 及以上,以实现更长(>10 秒)的视频合成。实验表明,AtlaVid大幅提高了超高分辨率长视频的生成效率,实现了高质量的UHR长视频生成,速度提升了60.9倍,并且训练成本显着降低,性能甚至比原生4K视频生成器更好。