论文
VIBE:视频指令对齐背景音乐生成
VIBE: Video Instruction-aligned Background music gEneration
摘要
当前的视频到音乐(V2M)模型缺乏语义控制,并且无法惩罚指令违规,这主要是由于它们对重建目标的依赖以及扩散自回归(DAR)架构中静态跨模态条件的表示瓶颈。为了解决这个问题,我们引入了 VIBE,一种新颖的文本和视频到音乐 (T+V2M) 生成模型,它利用:(1) Conditioning Connection,一种深度方向的跨层调节机制,动态地连接规划和扩散细化头;(2) 全面的奖励建模分类法,通过结构化的 5 阶段优化可验证的硬约束(例如节奏、调性)和软主观质量(例如音乐性、多模态对齐)训练课程。通过使用视听对齐、指令遵循和音频质量指标以及主观人类评估研究进行评估,我们观察到 VIBE 表现出增强的可控性和指令依从性,同时在生成保真度和多模态对齐方面的表现与大多数评估的基线相当。