论文

DUET:同时调整隐藏表示与声谱以控制语音情绪

DUET: Unified Dual-Space Emotion Control for Diffusion and Flow-Matching Driven Text-to-Speech

模型推理解码与生成控制

摘要

基于扩散和流匹配的文本转语音 (TTS) 模型在自然性方面表现出色,但往往缺乏明确的情绪控制,因为情绪信号仍然与说话者身份纠缠在一起。我们发现情感嵌入作为冻结隐藏状态的线性可解码方向出现,几乎与嵌入说话者身份的方向正交。这激发了即插即用框架 DUET,用于对基于预训练扩散和流匹配的 TTS 模型进行情感控制。在生成过程中,DUET 统一了双空间控制,以在单个每步更新中实现细粒度的情感干预:隐藏空间引导沿着目标情感方向移动生成,而梅尔空间引导通过从可微分声码器反向传播的梯度来细化频谱细节。我们在三个数据集的五个架构不同的预训练 TTS 主干上验证 DUET,其性能优于跨范式的 10 个受监督的最先进情感 TTS 基线,并实现了最高的人类评级情感适当性。为了进一步展示其定性行为,我们在 Ameca 人形机器人上部署 DUET,它在人形机器人上产生富有表现力的情感语音,展示了具身智能体即插即用情感交互的强大潜力。