论文
文本转语音模型中可组合情感引导的几何视角
A Geometric Perspective on Composable Emotion Steering in Text-to-Speech Models
摘要
虽然之前的工作已经探索了混合文本到语音系统中的情绪控制,但这些模块的几何特性及其对可操纵性的影响仍然知之甚少。我们首次对语音语言模型(SLM)和条件流匹配(CFM)模块作为混合情感语音合成的激活控制点进行比较研究。我们首先使用线性探测和局部内在维度(LID)来表征情感表示,然后评估混合情感合成的单点和联合转向。我们的结果表明,SLM 提供了一个干净的、低维的特定情感子空间,具有很强的说话人情感解纠缠,而 CFM 由于说话人情感纠缠而表现出较差的跨说话人泛化能力。联合转向增加了情绪强度,但降低了分布数据的比例控制和语音质量。这些发现为混合 TTS 系统中的多站点激活控制提供了实用指导,并强调了表示几何在可控语音生成中的重要性。