论文
SpeechLLM 与端到端 ASR 联合学习的结合:英语和意大利语案例研究
SpeechLLM Meets Federated Learning for End-to-End ASR: English and Italian Case Studies
摘要
联邦学习 (FL) 能够跨分布式数据源对自动语音识别 (ASR) 系统进行隐私保护训练,但其在大规模语音语言模型 (SpeechLLM) 中的应用仍未得到探索。本文首次系统地研究了基于 SpeechLLM 的端到端 ASR 系统的联合训练。我们设计了一种通信高效的联合优化策略,专门针对 SpeechLLM 架构的独特挑战,解决高维参数空间、梯度通信开销和分布式设置中的计算约束。通过对英语和意大利语单语 ASR 任务进行广泛的实证评估,我们证明了与不同声学条件和说话风格的集中训练基线相比,我们的联合方法的有效性和稳定性。此外,我们还进行了全面的消融研究,分析了联合框架内不同语音编码器架构对单语英语 ASR 性能的影响,为分散式训练的最佳模型配置提供了见解。我们的结果实现了具有竞争力的单词错误率,同时降低了通信成本,为现实世界多语言场景中的联合 SpeechLLM 部署奠定了实用基础。