论文
MSI-Bench:评估协作 AI 代理的多说话人语音交互
MSI-Bench: Evaluating Multi-Speaker Voice Interaction for Collaborative AI Agents
摘要
语音为人工智能代理提供了自然且直接的界面。语音代理可能有用的许多环境(包括会议、家庭和协作工作)本质上都是多讲话者。支持这些设置带来了一对一交互中基本上不存在的挑战。我们引入了多说话人交互基准(MSI-Bench)来评估多说话人语音交互。每个测试用例都是一个简短的多方多轮音频场景,其中包含参与者上下文、预期的工具调用和原子规则。该基准测试针对三个功能系列:多说话人内存、多说话人指令跟随和多说话人推理。它包含 1,152 个测试用例,中文和英文各占一半(各 576 个)。每个分割的最强配置仅在 66.8% 的英语和 54.5% 的普通话案例上通过了所有规则,而最强的开放权重配置则通过了 34.0% 和 19.3%。故障分析将感知与推理分开:开放权重模型受到多说话人音频前端的瓶颈,而前沿系统仍然无法在干净的文字记录上做出说话人范围的决策,并且全面的模型通常会在没有人解决这些问题时做出响应。这些结果将基于说话者的感知、说话者范围的决策和对话限制确定为未来语音代理的具体目标。