论文
RFM-编辑 2:具有整流流匹配和从粗到细扩散的文本引导音频编辑 Transformer
RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers
摘要
音频编辑的目的是根据文本指令或描述修改现有音频剪辑中的特定内容,同时保留剩余的声音内容。尽管扩散模型取得了显着进展,但现有的基于训练的编辑方法主要依赖于卷积 U-Net 主干中的局部归纳偏差和交叉注意交互,这往往会阻碍远程语义对齐以及指令的精确理解和本地化。相比之下,扩散Transformer提供了更强的全局建模和多模态融合,但现有的编辑架构通常采用简单的扩散Transformer块堆栈。对所有块中的串联音频和文本标记应用联合注意力会导致标记长度的二次复杂度。为了平衡编辑性能和效率,我们提出了一种基于整流流匹配(RFM)的新型指令引导音频编辑框架,名为 RFM-Editing 2,建立在混合两级扩散 Transformer 上。所提出的模型对音频和文本标记执行联合注意,以在低分辨率阶段建立粗略的语义对齐,然后切换到交替联合注意和交叉注意块,以在高分辨率阶段细化编辑细节。这种从粗到细的策略可以实现高效、准确的指令引导音频编辑。实验表明,所提出的框架在涉及重叠音频事件和复杂指令的挑战性编辑任务中取得了显着的性能提升,同时大幅提高了编辑效率。