论文
DASH:具有多层隐藏表示的双视图 Self-蒸馏,可实现强大的语音识别
DASH: Dual-View Self-Distillation with Multi-Layer Hidden Representations for Robust Speech Recognition
摘要
自动语音识别 (ASR) 在现实世界的噪声环境中通常会性能下降,因此噪声鲁棒性对于部署至关重要。有监督的噪声增强 微调 是一种常见的补救措施,但它可能会引入鲁棒性-干净的权衡和对特定损坏的过度拟合,从而降低干净条件下的识别能力。我们提出了 DASH,这是一个自 蒸馏 框架,它通过从配对视图中学习干净-噪声一致性来提高鲁棒性。 DASH 从多个编码器层中提取隐藏表示,以捕获从底层声学到高级语义的特征,并通过最小化干净视图和噪声视图的原型分配分布之间的 KL 散度来稳定训练。 LibriSpeech 上的实验表明,DASH 在不同噪声条件下持续提高识别能力,同时保持清晰的准确性,这是通过无标签 预训练 阶段实现的,其额外开销(约为 微调 时间的 4%)超出了标准 微调。