论文

从语音到可编辑概念:用概念瓶颈模型探索情感识别

From Speech to Editable Concepts: Probing Emotion Recognition with Concept Bottleneck Models

模型评测模型行为与机制分析

摘要

语音情感识别(SER)是为话语分配情感标签的任务。早期的系统依赖于声学特征,而最近的方法结合了多种模式,最常见的是语音和文本。尽管如此,许多数据集的性能仍然很差。因此,大语言模型 (LLM) 引起了 SER 的兴趣,因为它们可以与指令联合处理不同的输入。然而,直接音频输入引发了可解释性问题。为了解决图像分类中的类似问题,引入了概念瓶颈模型。这项工作将概念瓶颈应用于 SER,以检查个体预测如何依赖于文字记录、声学描述和说话者属性。实验在 CREMA-D、IEMOCAP 和 MELD 上测试了三个大语言模型,并通过不同的工具提取概念。在脚本语料库上,大语言模型强烈偏向于零样本设置中的转录本,这将 CREMA-D 上的 Macro-F1 从 27.8 降低到 5.8。微调消除了这种偏差,转录本将 Macro-F1 从 41.8 提高到 45.1。删除语速会将 CREMA-D 上 48% 的中性预测更改为厌恶;尽管 Macro-F1 几乎没有变化,但消除 MELD 上的强度水平会改变预测。这些发现表明,单独的总体性能变化并不能反映概念删除对个体预测的影响。