论文

读取词元空间中的情绪:语音LLM 的判别式适应情绪识别

Reading Emotions in the Token Space: Discriminative Adaptation of SpeechLLMs for Emotion Recognition

模型训练监督微调与指令调优

摘要

SpeechLLM 在情感识别方面表现出了强大的潜力,但它们从不适合分类的生成解码器中读取预测的情感:它可以发出目标集之外的标签,并倾向于频繁的类别。我们提出了一种判别性适应,通过分类头读取最终提示标记的隐藏状态,在一次前向传递中生成标签,而不修改主干网。由于该读出从隐藏状态开始,否则模型将进行解码,因此它在其他相同的语音LLM中提供了生成推理和判别推理的受控比较。我们将头部保留为单个线性层,以很少的准确性换取可解释性:每种情绪都成为 LLM 输出词元空间中的一个方向,从而揭示相关的词元。在 IEMOCAP 上,跨两个 SpeechLLM 架构,它改进了 Macro F1 并消除了幻觉,在真实的 ASR 转录本上获得了最大的收益。我们的分析表明,这些情感方向编码间接关联,反映了网络规模文本中的偏见。