论文
运动后语音声学基础模型的鲁棒性研究
Investigation on the Robustness of Acoustic Foundation Models on Post Exercise Speech
摘要
自动语音识别(ASR)已针对中性和静态语音进行了广泛的研究,但其在运动后生理变化下的鲁棒性仍有待探索。与休息时的言语相比,运动后的言语往往包含微呼吸、非语义停顿、不稳定的发声以及因呼吸支持减少而导致的重复,使得转录更加困难。在这项工作中,我们在统一的评估协议下对运动后语音的声学基础模型进行了基准测试。我们在现成的推理和域内训练后 微调 下比较序列到序列模型(Whisper 和 FunASR/Paraformer)和具有 CTC 解码的自监督编码器(Wav2Vec2、HuBERT 和 WavLM)。在静态/Post-All 基准测试中,大多数模型在运动后语音方面都会退化,而 FunASR 在 Post-All 上表现出最强的基线稳健性,WER 为 14.57%,CER 为 8.21%。 微调 极大地改进了几个基于 CTC 的模型,而 Whisper 则表现出不稳定的适应。作为一个探索性案例研究,我们进一步对流利和非流利的说话者的结果进行分层;尽管非流利子集很小,但它始终比流利子集更具挑战性。总体而言,我们的研究结果表明,运动后 ASR 的稳健性强烈依赖于模型,域内适应可能非常有效,但并非一致稳定,并且未来的运动后 ASR 研究应该明确地将流利度相关的影响与运动引起的语音变化分开。