论文
FreeSonic:无需训练 时间感知解耦注意力,实现精确音频编辑
FreeSonic: Training-Free Temporal-Aware Decoupled Attention for Precise Audio Editing
摘要
文本转音频 (TTA) 生成已取得重大进展,但实现精确一致的音频编辑仍然是一项重大挑战。然而,现有的方法很难平衡时间一致性和背景保留。在本文中,我们提出了 FreeSonic,这是一个利用最先进的基于整流流的 TangoFlux 模型的 无需训练 框架。 FreeSonic 利用优化的反转过程和联合文本音频注意力图来精确提取目标片段。对于内容编辑,一种新颖的预定注意力解耦限制了对目标区域的修改,同时保留了原始的声学背景。此外,面向任务的噪声注入增强了音频去除和非刚性替换等任务的多功能性。大量的实验结果表明,FreeSonic 通过为精确一致的音频编辑提供高保真且高效的解决方案,实现了卓越的平衡。项目和演示:https://free-sonic.github.io/