论文

Motif-视频 2B:技术报告

Motif-Video 2B: Technical Report

模型架构新型架构

摘要

训练强大的视频生成模型通常需要大量数据集、大量参数和大量计算。在这项工作中,我们询问是否可以在更小的预算下获得强大的文本到视频质量:少于 1000 万个剪辑和少于 100,000 个 H200 GPU 小时。我们的核心主张是,部分答案在于模型容量的组织方式,而不仅仅是模型容量的使用量。在视频生成中,即时对齐、时间一致性和精细细节恢复在通过同一路径处理时可能会相互干扰。 Motif-Video 2B 通过在架构上分离这些角色来解决这个问题,而不是仅仅依赖规模。该模型结合了两个关键思想。首先,当视频标记序列变长时,共享交叉注意力加强了文本控制。其次,由三部分组成的主干将早期融合、联合表示学习和细节细化分开。为了使该设计在有限的计算预算下有效,我们将其与基于动态词元路由和早期特征对齐到冻结预训练视频编码器的高效训练方法配对。我们的分析表明,后来的块比标准的单流基线发展出更清晰的跨框架注意力结构。在 VBench 上,Motif-Video~2B 达到 83.76%,超过了 Wan2.1 14B,同时使用的参数少了 7 倍,训练数据也少了很多。这些结果表明,仔细的架构专业化与以效率为导向的训练方案相结合,可以缩小或超过通常与更大的视频模型相关的质量差距。