论文

超越重建:用于音乐生成的全上下文生成式DiT

Beyond Reconstruction: Full-Context Generative DiT for Music Generation

模型训练预训练

摘要

混合音乐生成器将自回归语言模型的长期规划与基于扩散或流的声学渲染器的保真度相结合。然而,渲染器是使用干净的、源自目标的编解码器词元进行训练的,但部署时却使用了不完善的语言模型预测,从而产生了编解码器接口暴露偏差。我们没有将渲染视为简单的重建任务,而是将其制定为从不完美的离散计划生成完整上下文。我们引入了 FullDiT,这是一种条件 DiT,它将八个帧对齐的 RVQ 流与独立编码的字幕和歌词融合在一起,并在完整的声学潜在序列上使用非因果自注意力。在训练期间,错误匹配干扰调节 (EMDC) 将每个码本的替换率与教师强制的 top-1 错误率相匹配,并从余弦 KNN 邻域中采样接近未命中的标记,而无需更改声学目标。在推理时,四路无分类器指导 (4-CFG) 独立缩放编解码器、歌词和字幕指导增量。匹配的消融表明,EMDC 在合成损坏下将 ViSQOL 提高了 0.77,并且在与固定语言模型标记的非绑定比较中显然是首选。进一步的消融显示了整首歌曲上下文和渲染器端文本调节的收益。整个系统在 18 个自动指标中的 15 个指标上优于五个商业系统,并在人工分析音乐与人声排行榜上名列前三。演示页面位于 https://selinacloudl.github.io/fulldit-demo/。