论文
编码器中的幽灵:歌词到歌曲生成中的可解码艺术家身份表示
Ghost in the Encoder: Decodable Artist Identity Representations in Lyrics-to-Song Generation
摘要
可以提示文本到歌曲生成模型模仿特定艺术家或从他们的训练数据中复述整首歌曲。尽管这些现象已在小型数据集上以行为方式记录下来,但我们对可能引起这些现象的内部表征知之甚少。先前关于生成音频的可解释性工作主要集中于在模型激活中定位语义概念,例如流派或拍号。在这项工作中,我们展示了训练好的模型可以仅根据歌词来探测艺术家身份的线性可解码表示,而无需任何额外的标识符。通过 ACE-Step 1.5 的受控案例研究,涵盖 100 名艺术家的 2,000 首歌曲,我们证明了可以在模型的内部激活中识别与给定歌词集相关的艺术家,并且在推理过程中,该条件信号从歌词编码器传播到扩散骨干网。这些发现表明,歌词构成了艺术家级别的调节通道,而提示端复制保护措施并未解决这一问题。更广泛地说,我们的工作强调了如何使用潜空间分析来审核生成音乐模型从训练数据中隐式学习的内容。