论文

NemotronLabs VoiceChat:具有工具调用功能的开放式全双工语音到语音模型

NemotronLabs VoiceChat: An Open Full-duplex Speech-to-Speech Model with Tool Calling Capabilities

应用与实践语音交互与综合语音服务

摘要

我们推出 NemotronLabs VoiceChat,这是一种具有本机工具调用功能的开放式全双工语音到语音模型。 NemotronLabs VoiceChat 将流式语音编码器和纯解码器语言模型与用于代理文本和结构化函数调用的并行专用输出流、用于增量用户转录的辅助 RNN-T 分支以及流式 TTS 解码器相结合。这种设计使模型能够在统一的流架构中聆听、转录、推理、调用工具和说话,同时保留自然对话所需的时间行为。在 Full-Duplex-Bench 1.0 上,NemotronLabs VoiceChat 在评估的开放权重系统中实现了最低的暂停处理接管率、用户中断后 100% 的接管率以及 4.33/5 的中断后响应质量得分。在 Full-Duplex-Bench 1.5 上,93% 的情况下它会在用户反向通道后恢复响应。 NemotronLabs VoiceChat 在 VoiceBench 上获得了 55.1 的归一化平均值,在 Full-Duplex-Bench 3.0 (FDB 3.0) 上获得了 82.5% 的工具选择 F1,而参数准确性和端到端工具执行仍有待改进。这些结果表明,全双工交互、语音识别和生成、通用语言功能和外部工具使用可以集成在单个开放式语音到语音模型中,而无需牺牲实时会话行为。