论文

AgentSteerTTS:用于复合指令文本转语音的多代理闭环框架

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech

智能体系统Agent 架构与控制循环

摘要

虽然现有的文本转语音(TTS)模型表现出很高的表现力,但由于离散文本意图和连续声学实现之间的结构不匹配,对复合指令的细粒度控制仍然具有挑战性。受人类认知解耦的启发,我们引入了 AgentSteerTTS,这是一种多智能体闭环框架,专为复合指令的意图忠实表达控制而设计。首先,在我们的框架中,对抗性解缠代理通过学习可分离的身份和情感韵律子空间以及泄漏抑制正则化来减轻说话者的情感泄漏。接下来,双流锚定控制器使用大型声学原型库来基础抽象意图:检索代理选择表达锚,而综合代理通过门控注意力将它们融合成连续控制向量。最后,快慢反馈代理通过潜在梯度校正来细化输出强度,并使用高级感知批判来解决语义声学不匹配问题。复合指令基准和公共测试集的实验表明,AgentSteerTTS 对基准产生了一致且显着的改进,证明了所提出方法的有效性。