论文

迈向实时人类与人工智能音乐协同表演:利用潜在扩散模型和 MAX/MSP 生成伴奏

Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP

应用与实践内容创作

摘要

我们提出了一个实时人类与人工智能音乐协同表演的框架,其中潜在扩散模型响应实时上下文音频流生成乐器伴奏。该系统将处理实时音频输入、缓冲和播放的 MAX/MSP 前端与运行生成模型的 Python 推理服务器相结合,通过 OSC/UDP 消息进行通信。这使得音乐家能够在 MAX/MSP(一个完善的实时环境)中表演,同时与基于 Python 的大规模生成模型进行交互,克服了实时音乐工具和最先进的人工智能模型之间的根本脱节。我们将伴奏生成制定为滑动窗口前瞻协议,训练模型从部分上下文中预测未来的音频,其中系统延迟是一个关键约束。为了减少延迟,我们将一致性 蒸馏 应用于我们的扩散模型,实现了采样时间减少 5.4 倍,并且两个模型都实现了实时操作。通过对音乐连贯性、节拍对齐和音频质量的评估,这两个模型在回顾机制中都实现了强劲的性能,并随着前视的增加而优雅地降级。这些结果证明了基于扩散的实时伴奏的可行性,并揭示了任何此类系统必须导航的模型延迟、前瞻深度和生成质量之间的基本权衡。