论文
Lumos-Nexus:视频统一模型的同质潜在空间的高效频率桥接
Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
摘要
基于连接器的视频统一模型在基于指令的视频合成方面表现出了强大的能力,但将大型高保真生成器集成到统一训练循环中在计算上是令人望而却步的,限制了可实现的视觉质量。因此,我们提出了 Lumos-Nexus,这是一种训练高效的统一视频生成框架,有助于开发强大的推理驱动生成能力,同时显着增强视觉保真度。 Lumos-Nexus 采用两阶段设计:1)在训练过程中,只有一个轻量级生成器与理解块对齐,以学习接受推理驱动的语义控制。 2)在推理过程中,我们引入统一渐进频率桥接(UPFB),逐步将生成过程移交给共享潜在空间中的大容量预训练生成器,从而实现从粗到细的细化并生成高保真视频,而不会影响推理质量。为了填补推理驱动视频生成基准的空白,我们引入了 VR-Bench,它评估模型将推断的意图转化为连贯且语义一致的视频内容的能力。大量实验表明,Lumos-Nexus 在 VBench 上在视觉真实感和时间连贯性方面取得了显着的进步,同时在 VR-Bench 上表现出了强大的基于推理的生成性能。代码和模型可在 https://jiazheng-xing.github.io/nexus-lumos-home/ 获取。