论文

Harness TTS:用控制层实现上下文感知的表现力语音合成

Harness TTS: Towards Context-Aware Expressive Speech Synthesis with Harness Layer

智能体系统Agent Harness

摘要

语音助手的表达性语音合成需要灵活的风格控制,以适应明确的请求和更广泛的交互环境。我们提出了 Harness TTS,这是一个轻量级控制层,它围绕 TTS 引擎来外部化和管理其表达行为。它将风格控制重新表述为闭集提示工具路由:离线时,使用结构化元数据构建紧凑的风格提示工具注册表;运行时,LLM 规划器根据优先级感知的观察模式选择适当的工具,TTS 执行器使用相应的提示音频合成语音。我们在路由和合成任务上评估 Harness TTS。在路由方面,Qwen3-4B 在显式、隐式和冲突子集上实现了 74.3%、43.0% 和 64.6% 的 Top-1 准确率。对于语音合成,CosyVoice3 和 VoxCPM2 上的实验表明,Harness TTS 优于仅指令控制,实现了更高的指令遵循获胜率(CosyVoice3 上的胜率提升幅度为 23.1-35.6 分,VoxCPM2 上的胜率提升幅度为 13.8-20.0 分),并将 UTMOSv2 分数提高了 0.11-0.38。此外,4B 规划器在标准模式下在 50 毫秒内提供第一个工具推荐,为实时交互引入的延迟可以忽略不计。这些结果表明,为 TTS 引擎配备专用的 Harness 层可为语音助手表情控制提供实用、可审核且上下文感知的解决方案。