论文
Aura:通过基于 VLM 的语义对齐生成一致的多主题视频
Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment
摘要
主题驱动和多元素视频生成是可控视频合成的核心,但现有方法仍然难以保持身份一致性并建模多个主题之间的复杂关系。在本文中,我们提出了 Aura,一个用于高保真和身份一致视频生成的统一框架。为了更好地捕捉场景动态和主体交互,我们引入了人工智能导演级视频描述,为视频内容提供密集且结构化的描述。我们进一步利用具有可学习查询的视觉语言模型(VLM)从文本和视觉参考中提取多模态语义特征,涵盖全局语义和细粒度视觉线索。为了弥补 VLM 和 Diffusion Transformer (DiT) 之间的表征差距,我们设计了一种两阶段对齐策略,逐步将 VLM 特征映射到 DiT 特征空间。对于视觉调节,我们采用词元串联将参考信息直接注入到生成过程中。为了区分异构主题类型并减少常见的复制粘贴伪影,我们开发了一种主题感知的 RoPE-Shift 机制。为了进一步区分不同类别的参考图像,我们引入了主题感知的可学习标记。此外,我们引入了记忆词元来平衡具有不同数量参考主题的示例之间的训练信号。在推理过程中,Progressive-APG(自适应提示指导)进一步缓解了过饱和现象,并改善了与用户提示的语义对齐。最后,我们通过专用的数据构建管道构建高质量的视频主题图像数据集。大量的实验表明,我们的方法在单主体生成和更具挑战性的多元素场景上都实现了最先进的性能。