基于语言模型的文本转语音中情感表达控制的任务向量算法
Task-Vector Arithmetic for Emotional Expressivity Control in Language-Model-Based Text-to-Speech
摘要
我们研究了任务向量算法是否可以成功地控制模块化文本转语音 (TTS) 中的跨说话者情绪强度,并转移到基于上下文学习 (LM-TTS) 的语言模型骨干上构建的大规模 TTS 系统。通过对 Qwen3-TTS-12Hz-1.7B 上四个逐渐变窄的操作数进行系统消除研究 - 通过 LoRA 微调 进行模型权重、连续编解码器嵌入、离散编解码器标记以及由与合成主干联合训练的 ECAPA-TDNN 编码器生成的说话者嵌入(x 向量) - 我们将情感韵律的主要载体定位到 x 向量。基于这一发现,我们提出了一种基于 x 向量空间中的质心算术的 无需训练 方法:将情感方向 $τ= \mathbb{E}_i[x(s_i,\text{emo})] -\mathbb{E}_i[x(s_i,\text{neutral})]$ 应用于看不见的目标说话者,如 $x_{\text{new}} = x(\text{目标},\text{中性}) + α\cdotτ$。使用 ESD(英语)作为 $τ$ 源,emoUERJ(巴西葡萄牙语)作为跨语言 真值 目标,我们观察到英语保持者的情感2vec 余弦相对于 ICL 基线平均增益 $+0.29$,巴西葡萄牙语保持者的情感2vec 余弦平均增益 $+0.09$,同时很大程度上保留了身份(多说话者的 WavLM SECS $\gtrsim 0.88$) $τ$ 变体)和可懂度(PT-BR 中的 WER $\approx 0$)。这些结果提供了初步证据,表明此类模型中情感韵律的主要载体可以通过消除定位到共同训练的说话人嵌入,其中 无需训练 质心算法即使在跨语言迁移下仍然有效。