论文

2026中国之声挑战赛总结:数据、任务、基线和方法

Summary of the ChinaVoices Challenge 2026: Data, Tasks, Baseline, and Methods

模型评测基准与评测资源

摘要

本文对ChinaVoices Challenge 2026进行了总结,该挑战赛旨在建立统一的汉语方言语音处理任务定义和评估条件,推进多方言识别和自动语音识别。该挑战赛涵盖16个方言类别,定义了汉语多方言识别和汉语多方言自动语音识别(ASR)两项任务。它使用参考集、开放评估集和隐藏评估集约 320 小时的语音。这两个任务使用相同的评估音频,并且每个任务都包含受限数据和开放数据轨道。我们描述了任务设置、数据、评估指标和 Qwen3-ASR-1.7B 基线,并分析了排行榜结果和提交的系统。共有28个团队提交结果,17个团队提供系统报告,15个团队的系统通过合规审查并纳入分析。大多数符合条件的系统都优于基线,并且这两项任务的隐藏评估集上的官方前三名顺序保持不变。方言级别的结果表明,识别准确度较高的类别通常具有较低的 ASR 错误率,尽管任务评估相关但不同的能力。领先的识别系统通常利用方言辨别声学表示,而领先的 ASR 系统则强调数据标准化、增强和辅助 CTC 目标。这些结果为开发和评估汉语多方言语音处理系统提供了实践指导。