论文
在基于LLM的文本转语音中追踪稀疏情绪控制电路
Tracing a Sparse Emotion-Control Circuit in LLM-Based Text-to-Speech
摘要
基于LLM的文本转语音 (TTS) 模型可以生成情感表达的语音,但参考情感如何通过模型路由并在解码的语音中实现仍不清楚。我们引入了两个用于匹配中性和情感合成的情感敏感指标——编解码器轨迹得分和后期残留方向得分——并使用它们对激活修补干预进行评分。在受控匹配参考条件下,该分析确定了一个稀疏源到读出组件级电路:每种情绪 23--27 个注意力头和 MLP,大约 5% 的考虑组件恢复或抑制留出案例中 74--88% 的后期情绪读出转变。该电路将共享组件骨干模型与特定于情绪的组件相结合;在 48 例中,有 47 例交叉情绪激活交换降低了目标读出。在解码的语音中,相同的干预会在每种情绪的 24 个匹配对上产生音调、能量和频谱亮度的一致变化。 读出匹配的残余方向基线仅产生干预的音调效果的 17--27%,这表明内部读出运动本身并不能解释解码的声学变化。这些结果追踪了从参考导出的前缀信息到生成语音的情感相关属性的紧凑因果路线。
