论文

联合多语言语音大语言模型:架构和聚合策略基准测试

Federated Multilingual Speech-LLMs: Architecture and Aggregation Strategy Benchmarking

模型评测模型能力评测

摘要

我们提出了用于多语言自动语音识别 (ASR) 的联邦学习 (FL) 综合基准,在多语言 LibriSpeech 数据集上评估了四种语音-LLM 架构。我们比较了冻结和未冻结编码器配置的 FedAvg 和 FedProx,证明优化的学习率对于性能至关重要。具体来说,独立调整语音编码器、连接器和解码器的学习率可产生最低的错误率,而完整的三组件自适应(编码器和解码器的 LoRA,连接器的全面训练)可产生最佳的 FL 结果。我们观察到 FedProx 的功效依赖于架构,在多语言预训练架构中提供显着的优势(例如,在保持编码器固定的情况下,EuroLLM 优于 TinyLlama);这表明LLM骨干容量在调节异构数据分布的弹性方面发挥着关键作用。这些发现为在隐私敏感的分布式环境中部署多语言语音大语言模型提供了具体的设计指导。