论文

帮助音乐共创主体“倾听”:用于理解和生成的分层自我监督世界模型

Helping Music Co-Creation Agents 'Listen' Well: Hierarchical Self-Supervised World Models for Understanding and Generation

应用与实践内容创作

摘要

协作音乐代理需要足够丰富的内部表示来支持理解和生成,同时又需要足够灵活以适应人类保留代理的工作流程。我们提出了一种用于符号音乐的分层自监督“世界模型”:一个 255 万参数的 Swin V2 编码器,在 MIDI 钢琴卷帘图像上进行训练,具有 JEPA 风格的目标(音高和时移等方差、屏蔽嵌入预测和分布正则化器),不使用标签和音乐理论词汇。探测冻结的嵌入表明,音乐属性变得可解码的级别跟踪其音乐时间尺度:从最粗糙的级别读取乐句边界,从最精细的级别读取音符密度和和声细节。时间和短语结构仅从自我监督目标中产生,而和声内容则必须要求;小型和弦监控头将关节和弦恢复从 0.18 提高到 0.54,并且从未受监督的调检测从 0.16 提高到 0.70。遵循表示自动编码器范式,条件流匹配模型代表经过训练的解码器,从 PCA 减少的条件在像素空间中流动:它在像素 F1 $0.996$ 处重现目标窗口,并且控制变化偏离程度的相同的每级条件 dropout 还可以在没有修复特定采样器的情况下启用掩码修复的图形提示。该管道在 CPU 上运行,在 2.8秒内生成一条建议,在 Apple MPS 上则为 0.6秒,我们在现场交互式演示中对此进行了演示。与基于 LLM 的大脑相配合,这些功能提供了协作音乐创作代理的核心,为人类代理服务,而不是代替人类代理。