论文

用于低资源语音识别的自适应 Fisher-Whitened 互协方差

Adaptive Fisher-Whitened Cross-Covariance for Low-Resource Speech Recognition

模型训练参数高效训练

摘要

将多语言语音基础模型适应资源匮乏的语言仍然很困难,特别是对于在预训练期间表现不佳的语言。虽然参数高效微调 (PEFT) 降低了适应大型模型的成本,但 LoRA 等传统方法依赖于通用的低秩参数化,并且不明确使用下游任务信息来定义适应子空间。为了研究基于任务的 PEFT 是否可以更好地支持低资源 ASR,我们将 Fisher-Whitened 交叉协方差分析(FCCA)应用于 Whisper 和 Qwen3-ASR,并引入两个互补的扩展:利用结构化跨层共享的非对称耦合 FCCA(AC-FCCA)和在固定参数预算下跨投影矩阵重新分配适应能力的自适应排名 FCCA(AR-FCCA)。在受控的多语言实验下,我们对预训练期间代表性较差或不受支持的语言以及代表性良好的语言评估这些方法。标准 FCCA 与可训练参数预算匹配的 LoRA 具有竞争力,并且通常优于它。 AR-FCCA 在两种模型架构中提供了比标准 FCCA 最一致的改进,在多个评估设置中具有统计上显着的增益,同时保留相同数量的可训练参数。这些结果表明,基于任务的子空间构建对于低资源语音自适应是有效的,并且自适应秩分配提供了一种在不增加模型容量的情况下提高参数效率的稳健方法。