论文
面向自动语音识别的数据高效在线策略蒸馏
Data-Efficient On-Policy Distillation for Automatic Speech Recognition
摘要
构建有竞争力的自动语音识别(ASR)模型通常需要大规模音频监督,这使得复现与专用化成本高昂。我们研究Ark-ASR——一个用10万小时语音训练的0.6B参数音频条件语言模型,并考察强大的Qwen-ASR教师能否通过在线策略蒸馏迁移额外的识别能力。在普通话与英文ASR基准上,所提出的训练配方始终优于仅用监督微调,并在五个评测集中的四个上超越同规模的Qwen3-ASR-0.6B基线。这一成绩仅用10万小时语音即达成,相比之下Qwen3-Omni AuT编码器报告使用了2000万小时监督音频。更大的Qwen3-ASR-1.7B仍然更强,但结果表明,在音频预算小得多的条件下,教师引导的在线策略训练能大幅缩小紧凑型ASR模型的差距。一项支持重叠度诊断进一步表明,教师数据阶段提升了学生与教师的局部兼容性,这与近期关于在线策略蒸馏何时有效的分析相吻合。
