论文
LaDA-Band:用于生成人声到伴奏的语言扩散模型
LaDA-Band: Language Diffusion Models for Vocal-to-Accompaniment Generation
摘要
人声到伴奏(V2A)生成旨在将原始人声录音转换为完整编排的伴奏,本质上需要共同解决伴奏三难困境:保持声学真实性、保持与声带的整体连贯性以及在整首歌曲中产生动态编排。现有的开源方法通常会在这些目标之间做出妥协。连续潜在生成模型可以捕获较长的音乐跨度,但通常难以保留细粒度的声学细节。相比之下,离散自回归模型保留局部保真度,但在扩展环境中会受到单向生成和误差累积的影响。我们提出了 LaDA-Band,这是一个端到端框架,它将离散掩模扩散引入到 V2A 任务中。我们的方法将 V2A 生成公式化为离散掩模扩散,即一种全局的非自回归去噪公式,它将离散音频编解码器词元的表示优势与全序列双向上下文建模相结合。这种设计提高了长程结构一致性和时间同步性,同时保留了清晰的声学细节。在此基础上,LaDA-Band 进一步引入了双轨前缀调节架构、针对弱锚定伴奏区域的辅助替换词元检测目标,以及将离散掩蔽扩散扩展到整首歌曲人声到伴奏生成的两阶段渐进课程。对学术和现实世界基准的大量实验表明,LaDA-Band 在现有基线上不断提高声学真实性、全局一致性和动态编排,同时即使没有辅助参考音频也能保持强大的性能。代码和音频示例可在 https://github.com/Duoluoluos/TME-LaDA-Band 获取。