论文

SPEARBench:流式语音到语音语言模型的自然度评估基准

SPEARBench: A Benchmark for Naturalness Evaluation in Streaming Speech-to-Speech Language Models

模型评测基准与评测资源

摘要

流式语音到语音语言模型旨在通过合成语音直接回答口头查询。然而,标准语音和文本基准并不能捕捉这些系统在对话中是否表现自然,其中时间、轮流、韵律、人际立场、语言和方言一致性以及关系感知适当性共同塑造感知质量。我们引入了 SPEARBench,这是一个用于评估问答交互中语音到语音语言模型自然度的基准。 SPEARBench 从无缝交互语料库构建受控对话提示,跨多个模型运行推理,并使用多维协议评估生成的答案,该多维协议涵盖响应延迟、中断、语音质量、ASR 鲁棒性、语言和方言一致性、情感自然度、人际立场和可解释的分布基线。该基准包括原始人类答案作为参考条件,并报告几个当代模型的结果。结果表明,当前模型可以实现高信号质量和低 ASR 错误,同时在延迟、重叠、方言保留、情绪适应和人际立场动态方面仍与人类对话行为不同。