论文

APEX-Voice:语音Agent能否通过全双工交互完成专业工作流?

APEX-Voice: Can Voice Agents Complete Professional Workflows Through Full-Duplex Interaction

智能体系统Agent任务评测

摘要

全双工语音Agent现在可以在语音交互过程中听、说、使用工具和采取行动,但流畅的对话并不能保证正确完成委派的专业工作流程。我们引入 APEX-Voice,这是 120 个交互式专业工作流程的基准,涵盖表格填写、公司谈判、协调、咨询和面试等十种工作原型。每个工作流程都在有状态的语音工作台环境中执行,具有特定于任务的知识、类型化工具、带黄金注释的最终工作工件、授权约束以及由经过验证的预编译语音实现支持的用户模拟策略。我们评估工件字段的准确性和端到端工作流程的成功,这需要正确的最终状态、有效的流程、已完成的操作和有效的最终工件。在五个前沿实时语音Agent——GPT-Live-1、Gemini-3.8-Live、Grok-Voice-Think-2.0、Step-Audio3和GPT-realtime-2.1中,没有一个超过25%的Pass@1,最好的Reliable@3也只有10.8%。此外,状态协调是跨系统的主要故障点,而需要更多知识检索和语音中途更正的工作流程的成功率进一步下降。总体而言,APEX-Voice 是评估语音Agent能否将对话能力转化为可靠的专业工作的第一个基准。