论文
通过扩散热初始化进行音频到音频
Audio-to-Audio via Diffusion Warm Initialization
摘要
在本文中,我们提出扩散热初始化作为一系列音频到音频转换任务的简单而有效的方法。为了说明该方法的通用性,我们演示了它在音色传输、MIDI-to-Real 合成和多个音频增强任务中的使用。我们对音色传递进行了详细的实证分析,以研究初始化时间$t_\text{init}$的作用。 $t_\text{init}$ 的效果是使用基于音高的 Jaccard Distance 和 Fréchet Audio Distance 来评估的,以量化 忠实性 到输入信号并与目标分布对齐。我们的结果为选择 $t_\text{init}$ 提供了实用指导,并表明,一旦正确选择,单个预训练扩散模型与热初始化相结合就可以支持多个转换目标,而无需特定于任务的训练或调节。尽管很简单,但与专门为这些任务设计的更复杂的管道相比,这种方法已经取得了有竞争力的结果。我们进一步观察到,热初始化不一定需要显式的噪声注入,因为引导信号本身通常可以充当后向扩散过程的有效初始化状态。总之,这些发现表明,热初始化提供了一个简单而有效的框架,可以作为更复杂的音频转换管道的基本构建块。