论文
MAGE:与模态无关的音乐生成和目标源提取
MAGE: Modality-Agnostic Music Generation and Target-Source Extraction
摘要
多模式音频生成的最新进展使得可以根据文本、视觉提示和其他高级条件合成音乐。然而,大多数系统都是针对单一操作模式设计的:要么在没有参考混合物的情况下生成音乐,要么从现有混合物中提取目标源。当文本、视觉和混合输入的不同组合可用时,这种固定任务设计限制了它们的使用。为了解决这一差距,我们提出了 MAGE,这是一种与模态无关的框架,用于在共享连续潜在空间内进行条件音乐生成和基于混合的目标源提取。我们的方法引入了三个关键组成部分。首先,受控多模态 FluxFormer 对从噪声到目标音频潜在音频的条件流进行建模,使同一骨干网能够在有或没有混合条件的情况下运行。其次,视听连接对齐将帧级视觉特征映射到音频潜在序列上,从而允许视觉证据来调节音频 词元级 的生成过程。第三,跨门调制机制使用对齐的视觉表示来调节中间音频特征,而文本提供单独的语义指导。我们使用动态模态掩蔽进一步训练 MAGE,将相同的模型暴露于纯文本、纯视觉、联合文本-视觉、混合条件和无条件配置。 MUSIC 基准测试的实验在不同的协议下评估 MAGE,以实现无混合物生成和基于混合物的目标源提取。结果表明,MAGE 提供了跨两种设置的共享调节接口,并且所提出的对齐和选通组件改善了提取任务中的干扰抑制。