论文

JoyAI-Talker:专为移情语音代理构建的全双工语音交互大型模型

JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

应用与实践语音交互与综合语音服务

摘要

我们推出了 JoyAI-Talker,这是一种全双工语音对话系统,可提供强大的基础模型功能,同时增强同理心交互和语音代理智能。 JoyAI-Talker采用模块化的Thinker-Talker架构,并进一步实现了统一的语音文本联合训练管道,以缓解常见的“认知退化”瓶颈,从而在很大程度上保留了模型的核心文本推理、STEM和逻辑能力,同时将其扩展到基于语音的交互。对于表达性语音合成,Talker 模块采用文本可控的生成范例,使自然语言指令能够灵活控制声音属性和局部副语言事件,例如笑声和叹息,支持更具表现力和细粒度的语音响应。为了增强会话同理心,我们引入了角色自适应同理心响应(PAER)框架。 PAER 采用分层认知管道从原始输入音频中提取非语言说话者线索,例如性别、年龄和情绪状态,将它们合并到 Thinker 的 CoT 推理中,并生成上下文自适应响应,将语义上适当的文本与对话语级表达力和局部副语言事件(包括叹息、语速和音量)的细粒度控制结合起来。我们进一步集成了 Joy-Duplex,这是一种状态驱动、即插即用的全双工框架,可作为实时转弯控制的高效门控引擎。广泛的评估表明JoyAI-Talker在基础T2T和S2T基准上取得了极具竞争力的性能。在全双工评估中,系统在用户中断情况下达到了 0.88 的高响应率,同时在背景语音下保持极低的误触发率,证明了其为流畅自然的语音对话做好了准备。