论文

Vividh-ASR:用于鲁棒印度语语音识别的复杂性分层基准和优化动态

Vividh-ASR: A Complexity-Tiered Benchmark and Optimization Dynamics for Robust Indic Speech Recognition

模型评测基准与评测资源

摘要

微调 多语言 ASR 模型(例如适用于低资源语言的 Whisper)通常可以改善朗读语音,但会降低自发音频性能。为了诊断这种不匹配,我们引入了 Vividh-ASR,这是一种针对印地语和马拉雅拉姆语的复杂性分层基准,分为四个级别:演播室、广播、自发噪声和合成噪声。通过对学习率时间和课程顺序的对照研究,我们发现早期的大参数更新将全局 WER 提高了 12 个绝对点,而难以简单的课程则增加了自发演讲的收益。这些发现激发了反向多阶段 微调 (R-MFT) 的发展,这是一种训练方法,使参数高效的 244M Whisper 模型能够匹配或超过传统微调的 769M 模型。通过 CKA 和 SVD 进行的表征分析揭示了有效的调度集中在解码器中的自适应,从而保留了预先训练的编码器的声学几何结构。我们发布基准和模型。