论文

现场音乐扩散模型:高效的 微调 和 后训练 交互式扩散音乐发生器

Live Music Diffusion Models: Efficient Fine-Tuning and Post-Training of Interactive Diffusion Music Generators

模型训练监督微调与指令调优

摘要

交互式流媒体音乐生成承诺使用生成模型进行现场表演和共同创作,这是离线模型不可能实现的。然而,SOTA 模型存在于离散 AR 体系中,需要工业级别的计算来进行训练和推理。在这项工作中,我们研究了音频扩散模型在开源社区的广泛支持但非流式双向性质,是否可以有效地重新用于消费类硬件上可访问的交互式模型。通过批判性地审视现代的分块外画扩散流程,我们发现了推理过程中的关键低效率问题,这些问题导致计算效率比离散 AR 同行更差。我们提出了现场音乐扩散模型(LMDM),这是对生成扩散过程的简单修改,通过块式 KV 缓存恢复并超越离散现场音乐模型(LMM)的推理复杂性。与 LMM 不同,LMDM 通过我们新颖的 ARC-Forcing 范式进一步实现稳定的 后训练 对齐,从而减少错误积累,而无需任何显式 RL 或奖励模型。我们展示了 LMDM 在许多创意领域的应用,包括文本条件生成、基于草图的音乐合成和干扰。最后,我们展示了如何在真正的艺术家与 AI 协作中将 LMDM 用作生成工具,利用 LMDM 作为“生成延迟”来改变音乐家的即兴创作,以实现可变的音色效果,同时在消费游戏笔记本电脑上本地运行。