论文

AfriVox-v2:野外非洲语音识别的领域垂直基准

AfriVox-v2: A Domain-Verticalized Benchmark for In-the-Wild African Speech Recognition

模型评测基准与评测资源

摘要

最近的大语言模型(LLM)显示出强大的高资源语言语音识别和翻译能力。然而,非洲语言在基准中的代表性仍然严重不足,限制了它们在资源匮乏环境中的实际使用。虽然早期的基准测试了非洲语言和口音,但它们缺乏详尽的现实世界噪音和精细的领域评估。我们推出 AfriVox-v2,这是一个综合基准测试,旨在在非洲实际部署条件下测试语音模型。 AfriVox-v2 为所有支持的语言引入了“野外”无脚本音频。我们还引入严格的领域垂直化,评估政府、金融、卫生和农业等十个部门的模型准确性,并对数字和命名实体进行有针对性的测试。最后,我们对新一代语音模型进行了基准测试,包括 Sahara-v2、Gemini 3 Flash 和 Omnilingual CTC 模型。我们的结果揭示了现代语音模型在专业化、嘈杂的非洲环境中的真正泛化差距,并为开发人员构建本地化语音人工智能提供了可靠的蓝图。