论文

MusiChat:面向音乐创作的氛围作曲

MusiChat: Vibe Composing for Music Creation

应用与实践上下文与知识记忆内容创作Agent记忆

摘要

AI音乐生成的最新进展已使用户能够从自然语言提示创作完整的音乐作品。然而,大多数现有系统遵循提示-再生成范式,使迭代精修变得困难,因为用户必须反复重新创作乐曲,而不是直接演化已有的音乐构思。我们提出MusiChat,一个对话式氛围作曲系统,通过自然语言交互和迭代精修实现人机协作的音乐创作。MusiChat的核心是一个分层可控音乐生成框架,它将与歌词对齐的音乐结构生成同表现性的表层实现相分离,从而支持灵活的风格变换和保结构的编辑。该系统通过记忆增强架构将大语言模型与混合符号音乐引擎集成,在多轮交互中维护当前的作曲状态和用户历史。混合意图路由机制进一步支持对精确音乐编辑和开放式创作请求的高效解读。MusiChat不是从头重新生成乐曲,而是在保留相关音乐结构和用户意图的前提下,增量地变换一个不断演化的音乐作品。我们通过客观分析和人类研究评估MusiChat:单轮和多轮交互分别达到95.31%和100%的准确率,旋律自然度的喜欢与不喜欢之比为2:1,音乐质量为3:1。我们的结果表明,MusiChat通过对话界面支持连贯的多轮音乐创作和人机交互式共同创作。