论文

MP-Bench:将语音代理作为多方对话参与者进行评估

MP-Bench: Evaluating Voice Agents as a Multiparty Conversation Participant

模型评测基准与评测资源

摘要

对话式语音代理取得了显着进步,通过级联和端到端架构提供了越来越自然的人机交互。然而,虽然最近的基准测试广泛评估了二元交互和被动音频理解,但它们在很大程度上忽略了现实世界中普遍存在的场景:多方对话。由于对话的复杂性呈指数级增加,在这些环境中评估代理从根本上来说比二元交互更具挑战性。为了使语音代理无缝融入人类群体动态,它们不仅必须生成适合上下文的响应,而且还必须表现出对开放轮流的细致入微的理解。为了解决这一差距,我们引入了 Multiparty Bench (MP-Bench),这是第一个专门设计用于客观评估多方环境中作为活跃参与者的会话语音系统的基准。 MP-Bench 从两个主要维度评估座席行为:轮流意识和响应适当性。此外,我们将基于理解的问答任务作为补充评估。通过对 12 个语音代理进行基准测试,我们发现实时语音代理在多方理解上保持在 22% 或以下,并且在多方轮流上仍然接近机会,这对多方场景下的实时语音代理提出了公开的挑战。