论文

RW-Voice-EQ Bench:评估语音 AI 系统的真实世界基准

RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems

模型评测基准与评测资源

摘要

当前的语音人工智能基准通常评估孤立的功能,例如语音清晰度、单词错误率或基于文本的对话质量,但很少测试系统是否利用区分口语与其文本表示的声学信息。为此,我们推出了 Real World Voice EQ Bench,这是一个多维基准,用于评估文本转语音 (TTS)、语音转语音 (STS)、语音理解 (SU) 和自动语音识别 (ASR) 方面的语音 AI。我们的评估表明,绩效是高度特定于维度的。对于TTS来说,自然度、表现力、身份稳定性和可靠性在很大程度上是独立的评价维度。对于 STS,访问音频并不能保证使用声音效果,并且一些代理仍然主要由转录驱动。对于 SU,模型在副语言任务中的表现并不均衡。对于 ASR 而言,现实世界的口音、情绪、噪音和对话条件会暴露出已建立的干净语音基准未捕获的故障。总之,这些结果表明,语音人工智能应该作为声学、表达、交互和鲁棒性能力的概况来评估,而不是通过单一的总分来评估。