论文

VAmoS Bench:语音智能体模拟基准

VAmoS Bench: Voice Agent Simulation Bench

模型评测基准与评测资源

摘要

生产级语音智能体涵盖级联、语音到语音(speech-to-speech)与混合架构。语音智能体基准通常测量组件质量与对话特性,例如词错率、延迟、自然度与轮次切换。较少有基准测量智能体是否靠自己正确处理了一通电话。呼叫中心把这一点称为“containment”(自助解决率):无需转人工、由自动系统解决的电话占比。在某些来电上,正确的结局是拒绝或转介。为弥补这一空白,我们提出VAmoS Bench,即语音智能体模拟基准(Voice Agent Simulation Bench)。它在一个有状态的客服任务中对完整的语音智能体系统做端到端测量。智能体是Riley——一家虚构银行的信用卡客服代表,可以冻结、注销、更换或激活银行卡。100个场景各自提供一个带有私人目标的模拟来电者,以及一个带种子的PostgreSQL后端。平台利用每个场景填充并激活一个隔离的模拟环境,来电者通过音频与Riley通话;约三分之一的场景施加对抗压力。智能体可以使用五个对后端执行真实SQL的工具。每个场景还定义了二元断言。评分器对照完整轨迹来评估这些断言,轨迹涵盖来电者与智能体所说的全部内容以及智能体所做的全部操作,包括工具调用、参数与返回的行。这既能抓住声称已改卡却没有更新数据库的智能体,也能抓住正确更新了数据库却泄露受保护信息的智能体。本首个基准版本聚焦金融服务。其评估协议支持一个持续演进的排行榜:更多语音智能体可以在同一版本上接受评估,而后续版本则可扩展任务与场景。