论文

EchoEdit:用最优传输稳定无需反演的音频编辑

EchoEdit: Stabilizing Inversion-Free Audio Editing via Optimal Transport Geometry

应用与实践内容创作

摘要

使用预训练生成模型的文本引导音频编辑通常通过反演或噪声来实现。这种做法导致了结构上的权衡,因为更强的编辑需要对本应保持不变的节奏、瞬态、音色和长程结构进行更深层次的破坏。在这里,我们介绍 EchoEdit,一个用于真实音频编辑的 无需训练 和无反演框架,它通过区分源提示和目标提示条件下的漂移来直接构建编辑字段。这种结构避免了显式源反演、配对编辑数据和测试时优化,但其随机源边际引入了不确定性漂移,其中小的随机偏差沿着编辑轨迹累积,并且可以将编辑的潜在表示从音频数据流形中移开。为了解决这个限制,我们进一步提出了 EchoEdit+,这是一种最优传输正则化扩展,它通过最小化编辑变量和源条件音频流形之间的传输成本来稳定直接编辑路径。由此产生的 OT 耦合收缩了噪声状态下的随机位移,使模型查询更接近训练分布,并在允许语义变化的同时保留结构信息。音效和音乐编辑实验表明,与基于反演的基线和非正则化直接编辑器相比,EchoEdit+ 改进了目标提示对齐和源保存。代码和数据集将被发布。