论文
VoxMind:端到端代理语音对话系统
VoxMind: An End-to-End Agentic Spoken Dialogue System
摘要
最近的端到端语音对话模型可以实现自然交互。然而,随着用户需求变得越来越复杂,仅依赖会话能力的模型往往难以应对。因此,结合代理能力至关重要:通过支持工具的使用,这些模型可以扩展其知识边界并更好地解决现实世界的任务。然而,现有的研究主要集中在核心感知和生成上,对此类工具增强扩展的探索相对有限。为了弥补这一差距,我们推出了 VoxMind,这是一个集成框架,旨在为端到端口语对话模型配备全面的代理能力。利用我们精心策划的 470 小时 AgentChat 数据集,我们采用了“先思考后说话”机制,使模型能够内化结构化推理,作为规划和响应生成的关键先决条件。此外,为了缓解大规模工具集成造成的延迟瓶颈,我们提出了多代理动态工具管理架构。通过将检索任务异步委托给与主模型推理轨迹一致的辅助代理,该系统有效地将推理延迟与工具集大小解耦。实验结果证实,VoxMind 在代理性能方面取得了显着改进:与强基线相比,任务完成率从 34.88% 提高到 74.57%,在语音代理任务上优于 Gemini-2.5-Pro,同时保持一般对话质量。源代码和相关数据可在 https://github.com/MM-Speech/VoxMind 上公开获取。