论文

通过联合条件建模和渐进式训练统一音频生成和编辑

Unified Audio Generation and Editing via Joint Condition Modeling and Progressive Training

应用与实践内容创作

摘要

随着多媒体应用中对音频的日益关注,出现了许多关于音频生成的先进作品。现有的研究通常将文本到音频(TTA)和其他相关的音频生成任务(例如基于指令的音频编辑)视为独立的挑战,采用特定于任务的架构或模块。缺乏统一的建模范式大大增加了构建音频生成和编辑系统的开销和复杂性,同时也导致可扩展性有限。为了解决这个问题,我们引入了 AudioWeave,这是一种用于 TTA 和音频编辑的统一模型,无需额外的特定于任务的组件。具体来说,我们提出了一种具有分解位置嵌入的联合条件建模方法,使扩散 Transformer 主干能够在 TTA 和音频编辑的异构输入下运行。我们进一步提出了一种渐进的多阶段训练策略,以减轻由于多个任务之间的干扰而导致的任务竞争和灾难性遗忘。这反过来又有助于维持每项任务的绩效,甚至可能导致某些方面的改进。 TTA任务和六个音频编辑任务的实验结果表明,我们的统一模型取得了与特定任务模型竞争的性能,为进一步探索统一音频生成模型奠定了基础。