论文

从熵分配重新审视语音编码器与大模型的协同训练

Rethinking Entropy Allocation in LLM-based ASR: Understanding the Dynamics between Speech Encoders and LLMs

模型训练监督微调与指令调优

摘要

将 大语言模型 (LLM) 集成到自动语音识别 (ASR) 中已成为主导范例。尽管最近基于 LLM 的 ASR 模型在公共基准测试中表现出了良好的性能,但在识别质量与延迟和开销之间取得平衡仍然具有挑战性,而幻觉进一步限制了现实世界的部署。在本研究中,我们从熵分配的角度重新审视基于 LLM 的 ASR,并引入三个指标来描述训练范例如何在语音编码器和 LLM 之间分配熵减少。为了弥补主流方法中熵分配效率低下的问题,我们提出了一种基于能力边界意识、优化参数效率和幻觉鲁棒性的原则性多阶段训练策略。具体来说,我们重新设计了预训练策略以缓解语音文本模态差距,并进一步在对齐和联合 SFT 之间引入迭代异步 SFT 阶段,以保持功能解耦并约束编码器表示漂移。普通话和英语基准测试表明,我们的方法仅使用 2.3B 参数即可实现与最先进模型的竞争性能,同时还通过我们的解耦导向设计有效减轻幻觉。