论文

PolySpeech-100:跨 100 多种语言和方言的语音理解大型基准

PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects

模型评测基准与评测资源

摘要

虽然端到端 (E2E) Speech-大语言模型 (Speech-LLM) 正在迅速发展,但其评估方法仍然仅限于简单转录时代。现有基准面临三个关键限制:明显偏向高资源语言、关注低级识别 (ASR) 而不是语义推理、以及忽视地方方言。为了弥补这一差距,我们引入了 PolySpeech-100,这是一个大规模基准测试,旨在评估 110 种语言变体的“母语水平”语音理解能力。我们采用了一种新颖的混合构建管道,通过指令驱动的合成语音增强了黄金标准的人类录音,使我们能够覆盖 19 种不同的中国方言和 80 多种低资源语言。对 22 个最先进模型(包括 Gemini-3、GPT-Audio 和 Qwen2.5-Omni)的广泛评估产生了关键的见解。首先,我们证明开源 E2E 模型在重方言方面优于 Cascade (ASR+LLM) 系统,证明直接音频处理保留了标准转录中经常丢失的关键副语言线索和韵律特征(例如语调、重音)。其次,我们揭示了显着的性能差距:虽然商业模型保持稳健性,但开源模型在低资源语言上遭受灾难性的退化。最后,与直觉相反,我们观察到,在标准零样本设置下,思想链提示经常降低大多数评估模型的语音理解性能,揭示了当前架构中潜在的模态对齐差距。 PolySpeech-100 为下一代包容性、全功能的 Speech-LLM 建立了严格的标准。数据、演示和代码可在 https://github.com/YoungSeng/PolySpeech-100 上公开获取。