论文
全双工语音模型中工具调用的前后端架构
A frontend-backend architecture for tool calls in full-duplex speech models
摘要
全双工语音到语音 (S2S) 模型提供自然、低延迟的对话交互,并将受益于使用外部工具和完成语音代理任务的能力。我们提出了一种前端-后端架构,其中双工语音到文本前端学习发出委托词元,并将流式 ASR 转录本转发到基于文本的后端 LLM 以进行工具调用。来自后端的工具调用结果通过轻量级预填充和重复机制注入回前端,然后使用流式 TTS 合成给用户。我们的方法在很大程度上保留了常规的双工轮流、中断处理和低延迟交互,因为它需要对前端模型进行最少的修改。在单轮工具调用评估中,我们的系统实现了 92-97% 的工具调用召回率、有竞争力的工具调用预测性能以及拒绝不相关调用的 81.2% 准确率。当配备更大的后端(例如 Qwen3-235B-A22B)时,与开源和闭源模型相比,我们的系统在 Full-Duplex-Bench-V3 上取得了具有竞争力的结果,并且在 EVA-Bench 上显着优于 GPT-realtime-mini 和 Qwen3-Omni-30B-A3B-Instruct。这些结果表明,后端委派是一种有效的模块化方法,可将自然双工语音交互与强大的代理工具调用功能相结合。