论文

MAVIN:具有定制叙事控制的多镜头视听生成

MAVIN: Multi-Shot Audio-Visual Generation with Customized Narrative Control

应用与实践内容创作

摘要

虽然最近的生成模型可以生成高保真视频,但它们难以应对连贯的多镜头视听生成所需的复杂叙事控制。现有方法存在时间错位、可控性有限和脚本不完整的问题。在本文中,我们提出了 MAVIN,这是第一个具有定制叙事控制的多镜头视听生成框架。为了解决时间错位问题,我们提出了边界感知注意力,它利用分层场景描述和边界感知词元路由来在各自的时间边界内渲染视听元素。为了提高多主体场景的可控性,我们提出了 ID 感知传播,利用身份嵌入和身份感知掩模将特定身份与一致的视觉外观和音色绑定。为了提供全面的视听叙述,我们提出了一个多代理脚本管道,将自由格式的用户输入转换为分层场景描述。此外,我们构建了 MAVINSet,一个用于稳健训练和评估的多镜头视听数据集。大量实验表明,MAVIN 实现了最先进的性能,为将生成模型集成到专业电影制作工作流程中开辟了新途径。