论文
通过无数据流一致性生成实时交互式音乐 蒸馏
Real-Time Interactive Music Generation via Data-Free Streaming Consistency Distillation
摘要
交互式音乐和现场表演依赖于实时的人类表达,但由于其令人望而却步的推理延迟和离线渲染范例,现代生成音乐人工智能在该领域仍然基本上不存在。为了给先锋音乐家提供一种新颖的互动创作媒介,我们应该从根本上将这些静态模型转变为动态的、可演奏的乐器。在本文中,我们提出了一个弥补这一差距的框架。为了在不牺牲结构一致性的情况下实现实时交互所需的低延迟,我们在流式自回归潜在空间中制定了 蒸馏。我们的方法通过利用仅提示输入来动态合成教师指导的、块状的轨迹,从而消除了对昂贵的配对音频潜在数据集的需求。由于现场乐器需要高保真度,因此我们引入了音乐感知一致性目标,它结合了潜在、频谱和时间差异损失,以在加速单步流生成过程中保留音色、瞬态和节奏稳定性等关键品质。我们的 蒸馏 通过参数高效的自适应来实现,减少了生成步骤以实现低实时系数。至关重要的是,通过作为连续自回归流运行,系统可以动态地无缝吸收动态人类输入,从而使用户能够立即引导音乐轨迹,而无需中断音频流。最终,这项工作将生成文本到音乐的模型重新构建为响应式乐器,而不是被动的提示和等待系统,为实时人类与人工智能音乐共同创作开辟了新领域。