论文

Video-Robin:基于意图的视频到音乐生成的自回归扩散规划

Video-Robin: Autoregressive Diffusion Planning for Intent-Grounded Video-to-Music Generation

应用与实践内容创作

摘要

视频转音乐 (V2M) 是为输入视频创建背景音乐的基本任务。最近的 V2M 模型通常仅依靠视觉调节来实现视听对齐,并为最终用户提供有限的语义和风格可控性。在本文中,我们提出了 Video-Robin,这是一种新颖的文本条件视频到音乐生成模型,可以为视频内容生成快速、高质量、语义一致的音乐。为了平衡音乐保真度和语义理解,Video-Robin 将自回归规划与基于扩散的合成相结合。具体来说,自回归模块通过在语义上对齐视觉和文本输入来模拟全局结构,以产生高级音乐潜伏。随后使用局部扩散 Transformer 将这些潜伏细化为连贯的高保真音乐。通过将语义驱动的规划纳入基于扩散的合成中,Video-Robin 可以在不牺牲音频真实感的情况下实现细粒度的创作者控制。我们提出的模型在分布内和分布外基准上均优于仅接受视频输入的基线和附加特征条件基线,与 SOTA 相比,推理速度提高了 2.21 倍。一旦论文被接受,我们将开源一切。