论文

UniAE-MoE:通过混合专家融合多领域音频编码器

UniAE-MoE: A Unified Audio Encoder via Mixture of Experts

摘要

大型音频语言模型 (LALM) 依靠有效的音频编码器来实现多任务性能。我们推出 UniAE-MoE,这是一种统一的音频编码器,旨在对跨域音频表示进行建模,并通过专家混合 (MoE) 架构实现出色的下游理解性能。具体来说,我们探索了主流音频编码器,并集成了来自 Qwen2-Audio 和 Audio-Flamingo 3 的编码器,它们展示了卓越的下游能力。为了促进有效的模型融合,我们使用 SwiGLU 与共享专家来改进编码器以解耦编码器网络,并且我们进一步引入了两阶段指令调整策略,以更好地使模型适应不同的下游任务。此外,我们提出了特定任务数据扩展(TSDS)技术来增强UniAE-MoE的理解能力。在 XARES-LLM 基准测试中,UniAE-MoE 的得分为 0.802,达到了最先进的性能。它还在官方 Interspeech 2026 音频编码器能力挑战赛中提供了顶级性能,进一步证明了跨不同音频任务的强大泛化能力。总之,这些结果验证了跨语音、音乐和一般音频领域UniAE-MoE统一音频理解的有效性。