论文
MI-MIDI:通过探测、镜头和转向对文本到 MIDI 生成模型进行机械解释
MI-MIDI: Mechanistic Interpretability of Text-to-MIDI Generation Models via Probing, Lenses and Steering
摘要
音乐生成的机械解释主要集中在音频模型上,而符号模型在很大程度上尚未得到探索。我们分析了两种对比设计的公共文本到 MIDI 系统:专用编码器 - 解码器 text2midi 和 MIDI-LLM、使用线性探测、logits 和调谐镜头、激活修补和均值差异控制的 MIDI 词元扩展的 Llama~3.2~1B 模型。通过这些方法,我们恢复了具有音乐意义的结构,并展示了建筑如何塑造其形成和控制。音调、乐器、和声和纹理在两个模型中都是线性可解码的。 text2midi 在深度上逐渐完善预测,而 MIDI-LLM 主要在其继承的文本基础上工作,然后急剧后期旋转到音乐词汇中;修补可识别提示驱动乐器传输的匹配后期衰减。转向会在两个系统中产生音域和复调的双向变化,并在 MIDI-LLM 中产生节奏/能量的双向变化。我们的双向协议隔离了方向控制,并表明所有层干预在 text2midi 中都很强大,但在 MIDI-LLM 中会破坏性地累积。总之,这些结果提供了一个实用的工具包,用于在符号生成器中跟踪和控制音乐概念。演示网站上提供了音频示例。