论文
Qwen-Audio-3.1-Realtime:迈向可靠的代理语音交互
Qwen-Audio-3.1-Realtime: Towards Reliable Agentic Voice Interaction
摘要
实时语音助手必须推理不断变化的请求、执行操作并遵循对话规则。 Qwen-Audio-3.1-Realtime 通过思考、行动、说话和协调将这些要求结合在一起。 Think 将 Core-Cocktail 监督微调与多模态和多教师按策略蒸馏 (M$^{2}$-OPD) 相结合,以传递语言能力并培养本地音频技能。 Act 使用自我演化的可执行环境和多粒度部署进行组相对策略优化 (GRPO),教导模型使用工具、解释反馈和完成任务。说话和协调协调助理是否、何时以及如何说话或行动。我们评估音频推理、多语言理解、工具使用、对话行为、全双工交互和安全性。与 Qwen-Audio-3.0-Realtime 相比,3.1 将 $\tau$-Voice 的半双工语音到文本改编的总体任务成功率从 78.4% 提高到 82.0%。在语音到语音 Full-Duplex-Bench v1.5 上,对背景语音的响应率从 73.0% 下降到 13.0%。我们还提出了一个单独的语音Harness原型,使用 Qwen-Audio-3.0-Realtime 作为前台,通过前台-后台协调和记忆将语音交互扩展到持久任务。