论文

儿童语音识别适配与成人能力保留的实证研究

Child ASR Adaptation with Adult Retention: An Empirical Study

模型评测模型训练模型优化应用与实践监督微调与指令调优模型合并模型能力评测语音识别与转写

摘要

自动语音识别 (ASR) 系统对于儿童和非母语人士来说通常表现不佳,而使成人 ASR 模型适应儿童语音可能会导致成人语音遗忘。我们研究儿童 ASR 适应和成人保留的阿拉伯语和英语。我们比较了编码器-解码器、编码器-CTC 和基于 AudioLLM 的 ASR 系统的完整微调、LoRA 和事后权重空间合并。实验使用阿拉伯语母语和非母语儿童语音、英语 MyST 儿童语音以及来自 MGB-2 和 LibriSpeech test-clean 的成人基准。我们使用 WER 评估识别质量,并使用保留指数、儿童适应增益和适应恢复来量化适应-保留权衡。结果表明,儿童适应是必要的,特别是对于非阿拉伯语和英语母语的儿童语音,但直接适应往往会降低成人 ASR 表现。双语适应比特定语言适应更稳定。权重空间合并通常会改善权衡,特别是对于编码器(CTC、Whisper 和基于 AudioLLM 的 ASR),LERP 有利于成人保留,TIES 可以恢复更强的儿童收益。对于编码器-解码器模型,直接双语微调在原始 WER 中仍然最强。\footnote{代码和模型可在 https://github.com/qcri/Child-ASR-Adaptation。 获得

儿童语音识别适配与成人能力保留的实证研究:论文原图
图 1:跨架构、适应方法和成人保留评估的儿童 ASR 适应流程概述。