论文

熵感知领域路由专家混合演讲-LLM框架:多领域儿童-成人ASR案例研究

Entropy-Aware Domain-Routed Mixture-of-Experts Speech-LLM Framework: A Case Study of Multi-Domain Child-Adult ASR

摘要

虽然语音 大语言模型 (Speech-LLM) 在成人自动语音识别 (ASR) 上取得了出色的性能,但其对儿童语音的有效性仍未得到充分探索,并且单一模型通常难以同时处理不同的成人和儿童年龄组。本文提出了一种专家混合 (MoE) 语音 LLM,用于跨不同环境和年龄组的成人和儿童语音的统一 ASR。该框架采用基于分类器的域路由器 (C-DR) 和从粗到细的策略,并集成投影仪混合 (MoP) 和 LoRA 混合 (MoL) 来对特定于域的变化进行建模。为了解决域边界附近的路由不确定性,引入了熵感知路由(EAR)机制来动态合并共享专家。对公共儿童语料库的实验表明,在保持成人 ASR 表现的同时,其相对于基线的持续改进。据我们所知,这是第一个利用 Speech-LLM 进行涵盖儿童和成人的统一、多域 ASR 的工作。