论文

VAmoS Part Deux:更难、更现实的语音Agent模拟

VAmoS Part Deux: Harder, More Realistic Voice-Agent Simulation

智能体系统Agent任务评测

摘要

生产中的语音Agent必须处理多个请求、背景语音和失去耐心的客户。我们推出了 VAmoS Energy,这是一个基准,它将这些挑战结合在 100 个有关公用事业计费和支付援助的电话中。每个呼叫者都会提出两到四个请求。该Agent拥有 16 个工具,由有状态的 Stripe 计费双胞胎和 Apache Fineract 贷款引擎支持,在呼叫者验证成功之前,帐户访问将被阻止。这些任务使用公共家庭用电数据和基于宾夕法尼亚州住宅计费规则的政策。大语言模型作为验证者根据明确的要求检查Agent的行为和口头数据。在校准运行中,它在 99.1% 的检查中与代码验证器一致。在 14 个语音堆栈和每个任务 3 次重复中,完成率范围为 17.3% 到 44.7%。 Grok Voice 处于领先地位,Gemini 3.8 Live 和 GPT-Live 紧随其后,每次通话费用大致相同。背景电视将汇总完成率从 38.7% 降低到 8.6%。模拟呼叫者经常接受不正确的结果,因为它听到了Agent的话语,但无法检查其操作。这些发现说明了为什么语音Agent需要在整个通话过程中进行评估,包括他们所说的内容、他们改变的内容以及他们如何处理竞争性语音。