论文

舞台自适应音频扩散建模

Stage-adaptive audio diffusion modeling

模型训练预训练

摘要

基于扩散的音频生成和恢复方面的最新进展显着提高了异构调节机制的性能,包括文本调节音频生成和音频调节超分辨率。然而,训练音频扩散模型的计算成本仍然很高,并且大多数现有管道仍然依赖于静态优化方法,这些方法将训练信号的相对重要性视为在整个学习过程中固定的。在这项工作中,我们认为效率低下的一个主要根源在于语义获取和面向生成的细化之间不断变化的平衡。早期训练更加强调获取与条件一致的语义结构和粗略的全局组织,而后期训练则越来越强调时间一致性、感知保真度和细节细化。为了描述这种不断变化的平衡,我们引入了一个基于进度的制度变量,该变量源自 SSL 空间差异的训练时间斜率,用于衡量训练期间的语义进度。基于这个信号,我们开发了三种互补的阶段感知机制:用于早期语义引导的衰减 SSL 指导、由状态变量驱动的自适应时间步采样,以及从参数空间中的收敛分组组织激活的结构感知正则化。我们在文本条件音频生成和音频条件超分辨率上评估这些机制。在这两种设置中,所提出的阶段感知策略改善了收敛行为,并在主要生成和频谱重建指标上相对于标准静态基线产生增益。这些结果支持这样的观点:将外部指导、内部组织和优化重点视为阶段相关的组成部分而不是固定的成分,可以使有效的音频扩散训练受益。