论文

AdaLTM:利用 ASR 知识集成进行分类语音情感识别的自适应逐层任务向量合并

AdaLTM: Adaptive Layer-wise Task Vector Merging for Categorical Speech Emotion Recognition with ASR Knowledge Integration

模型优化模型合并

摘要

将自动语音识别 (ASR) 集成到语音情感识别 (SER) 中可以通过提供语言上下文来增强建模。然而,传统的特征融合面临性能瓶颈,多任务学习经常遭受优化冲突。虽然任务向量和模型合并已经解决了 NLP 和 CV 中的此类冲突,但它们在语音任务中的潜力在很大程度上仍未得到开发。在这项工作中,我们提出了一种基于 WavLM-Large 的自适应逐层任务向量合并(AdaLTM)框架。我们不是联合优化,而是从在情感数据集上微调的域内 ASR 和 SER 模型中提取任务向量。使用分层可学习系数将这些向量集成到冻结的基础模型中。该策略能够在 Transformer 层上实现语言和副语言知识的深度感知平衡,而不会产生梯度干扰。 MSP-Podcast 上的实验表明,所提出的方法有效地缓解了 ASR 和 SER 之间的冲突。