论文
EVA-Bench:用于评估语音代理的新端到端框架
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
摘要
语音代理越来越多地部署在企业应用程序中。然而,现有的基准还没有共同解决真实的对话模拟和全面的特定语音评估。我们推出了 EVA-Bench,这是一个解决这两个问题的端到端评估框架。在模拟方面,EVA-Bench 通过自动模拟验证来协调动态机器人到机器人的音频对话,该验证可以检测用户模拟器错误并在评分之前适当地重新生成对话。在测量方面,EVA-Bench引入了两个复合指标:EVA-A(准确度)和EVA-X(体验)。 EVA-Bench 包括跨三个企业领域的 213 个场景、用于口音和噪声鲁棒性的受控扰动套件,以及区分峰值与可靠能力的多次试验测量。在跨越所有三种架构的 12 个系统中,我们发现:(1) 没有系统在 EVA-A pass@1 和 EVA-X pass@1 上同时超过 0.5; (2) 峰值性能和可靠性性能相差很大(EVA-A 上的中值 pass@k--pass^k 差距为 0.44); (3) 口音和噪声扰动暴露了巨大的鲁棒性差距,其影响因架构、系统和指标而异(平均 $Δ$ 高达 0.314)。我们根据开源许可证发布 EVA-Bench。