论文
DirectAudioEdit:通过扩散预测对比度进行无反转文本引导音频编辑
DirectAudioEdit: Inversion-Free Text-Guided Audio Editing via Diffusion Prediction Contrast
摘要
文本引导的音频编辑旨在修改语言指定的声学内容,同时保留与编辑无关的源组件。现有的 无需训练 方法通常依赖于基于反转的编辑。虽然无反转编辑很有吸引力,因为它可以减少计算开销和重建错误,但它在音频编辑方面仍然很大程度上未被探索。关键的挑战是通过扩散去噪动力学构建源到目标的编辑路径。在本文中,我们介绍 DirectAudioEdit,这是开发 无需训练 和无反转音频编辑方法的首次尝试。跨两个主干网的音乐和事件级基准测试表明,与 DDPM 反转相比,DirectAudioEdit 将宏平均 FAD 和 KL 降低了 15.9% 和 15.8%,同时实现高达 64.5% 的编辑加速。