论文

MSU-Bench:在多说话人对话场景中实现以说话人为中心的理解

MSU-Bench: Towards Speaker-Centric Understanding in Conversational Multi-Speaker Scenarios

模型评测基准与评测资源

摘要

口语理解 (SLU) 正在从特定于任务的管道转向生成自然语言响应的大型音频语言模型 (LALM)。然而,现有的语音基准主要集中在单说话人设置或孤立的子任务上,从而导致对现实多说话人对话中以说话人为中心的理解的评估不足。我们推出了 MSU-Bench,这是一种多说话人对话理解的诊断基准,涵盖了从说话人基础到对话推理的两层框架中的 16 个以说话人为中心的任务和 2,300 个 QA 实例。我们构建了一个 Gemini 辅助注释和 QA 生成管道,具有人机循环验证功能,实现了高 QA 有效性以及人类答案和经过验证的标签之间的高度一致性。我们进一步分析说话者参考方案和诊断错误类型,以揭示说话者对应和推理的瓶颈。实验揭示了模型系列之间的明显差距,闭源系统总体领先,但所有模型仍然面临复杂说话者对应和多说话人推理方面的挑战。基准注释、元数据和评估脚本将在 GitHub 存储库中提供:https://github.com/ASLP-lab/MSU-Bench。