论文

SCB:用于评估语音到语音模型中的多轮推理的 SpeechConversationBench

SCB: SpeechConversationBench for Evaluating Multi-Turn Reasoning in Speech-to-Speech Models

模型评测基准与评测资源

摘要

语音到语音系统必须解决在会话过程中出现需求的任务。我们推出了 SpeechConversationBench (SCB),它是使用 103 个分片 GSM8K 问题对口语数学推理进行集中评估的方法。该框架比较了一轮中交付的原始问题(完整)、一起交付的串联信息碎片(concat)以及跨回合增量口头披露(分片)。我们报告了四种商业语音系统和LEGO的最终答案准确性,LEGO是 SCBX 创新实验室团队内部开发的专有语音管道,具有明确的对话上下文管理功能。相对于 concat,四个商业系统的分片准确率下降了 5.0-25.3 个百分点。LEGO在所有三种条件下都达到了 77.5% 的准确度,而 GPT-4o Realtime 的分片准确度为 76.6%。两个单轮基线区分了对问题重新表述的敏感性和增量语音交互带来的额外挑战。