论文
使用稀疏自动编码器解释和引导文本到语音语言模型
Interpreting and Steering a Text-to-Speech Language Model with Sparse Autoencoders
摘要
语言模型日益成为文本转语音 (TTS) 系统的支柱,但当文本和生成的语音标记共享单个残余流时,我们对它们所构建的表示知之甚少。我们在 CosyVoice3 的 LM 主干上训练 BatchTopK 稀疏自动编码器,并引入模态感知自动插入管道,该管道从触发文本前缀上下文、1 秒语音剪辑或两者的位置标记每个特征。恢复的特征是可解释的,涵盖音素、笑声、口音提示和说话者性别。通过 SAE 潜在空间的引导表明,这些特征是因果性的,而不仅仅是描述性的:有针对性的干预将笑声概率从 0.02 提高到 0.79,翻转感知的说话者性别,并在保留语音内容的同时控制语速。因此,SAE 特征既可以作为可解释性对象,也可以作为 TTS 合成的控制方向。