论文
SteerSpeech:通过激活干预控制生成语音情绪
Steerspeech: Activation Steering For Emotion Control In Generated Speech
摘要
预训练的文本转语音 (TTS) 模型可以生成富有表现力的语音,但可靠的推理时情绪控制仍然具有挑战性:提示和参考音频提供粗略、不一致的控制,而专门的调节和模型适应则需要昂贵的训练。我们提出了 SteerSpeech,一个轻量级的激活引导框架,它通过将引导向量注入隐藏的激活来控制情绪。对于每种目标情绪,我们使用多专家目标训练一个轻量级低阶变换,该目标鼓励单调情绪控制,同时保留说话者身份和语言内容、限制转向漂移并保持 TTS 主干冻结。为了通过离散语音Token进行优化,我们引入了一个两遍生成和重播管道,使用直通估计器通过采样Token反向传播专家监督。推理时,目标情感转向方向通过其各自的变换进行优化,并注入到基础 TTS 模型中。使用 Qwen3-TTS 对已见、未见和重音进行客观和主观评估 说话者表现出更强的连续情绪控制,而说话者和内容的退化有限。 SteerSpeech 实现了 1.08x-7.12x 基线目标情绪分数,对于主观代表性情绪,它在高转向强度下获得 78.1%-96.8% 的强度偏好和 1.43x-1.46x 的说话者身份保留。
