论文

SANA-WM:利用混合线性扩散进行高效的微小尺度世界建模 Transformer

SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer

模型架构混合架构

摘要

我们推出 SANA-WM,这是一种高效的 2.6B 参数开源世界模型,经过本机训练,可生成一分钟,通过精确的摄像机控制合成高保真、720p、分钟级视频。 SANA-WM 实现了与 LingBot-World 和 HY-WorldPlay 等大型工业基准相当的视觉质量,同时显着提高了效率。四个核心设计驱动我们的架构:(1) 混合线性注意力将逐帧门控 DeltaNet (GDN) 与 softmax 注意力相结合,以实现内存高效的长上下文建模。 (2) 双分支相机控制确保精确的 6-DoF 轨迹遵循。 (3) 两阶段生成管道将长视频精炼器应用于第一阶段输出,提高了序列之间的质量和一致性。 (4) 鲁棒注释管道从公共视频中提取准确的公制尺度 6-DoF 相机姿势,以产生高质量、时空一致的动作标签。在这些设计的驱动下,SANA-WM 在数据、训练计算和推理硬件方面展现了卓越的效率:它仅使用 $\sim$213K 公共视频剪辑和公制尺度姿势监督,在 15 天内完成 64 H100 的训练,并在单个 GPU 上生成每个 60 秒的剪辑;其经过提炼的变体可以部署在具有 NVFP4 量化功能的单个 RTX 5090 上,以便在 34 秒内对 60 秒的 720p 剪辑进行降噪。在我们的一分钟世界模型基准测试中,SANA-WM 表现出比之前的开源基线更强的动作跟踪准确性,并以高 36 美元\倍的可扩展世界模型吞吐量实现了可比的视觉质量。