论文

面向自动语音识别的数据高效在线策略蒸馏

Data-Efficient On-Policy Distillation for Automatic Speech Recognition

摘要

构建有竞争力的自动语音识别(ASR)模型通常需要大规模音频监督,这使得复现与专用化成本高昂。我们研究Ark-ASR——一个用10万小时语音训练的0.6B参数音频条件语言模型,并考察强大的Qwen-ASR教师能否通过在线策略蒸馏迁移额外的识别能力。在普通话与英文ASR基准上,所提出的训练配方始终优于仅用监督微调,并在五个评测集中的四个上超越同规模的Qwen3-ASR-0.6B基线。这一成绩仅用10万小时语音即达成,相比之下Qwen3-Omni AuT编码器报告使用了2000万小时监督音频。更大的Qwen3-ASR-1.7B仍然更强,但结果表明,在音频预算小得多的条件下,教师引导的在线策略训练能大幅缩小紧凑型ASR模型的差距。一项支持重叠度诊断进一步表明,教师数据阶段提升了学生与教师的局部兼容性,这与近期关于在线策略蒸馏何时有效的分析相吻合。

面向自动语音识别的数据高效在线策略蒸馏:论文配图
图 1:Ark-ASR 模型架构。音频分支遵循 GLM-ASR 编码器设计:Whisper 风格的音频编码器产生帧级声学状态,这些状态被归一化、临时合并,并由 MLP 适配器投影到 Qwen2 因果语言模型的隐藏维度中。这些音频嵌入取代了 ASR 提示中的占位符音频令牌嵌入,之后因果解码器自回归生成转录令牌。