论文

暴露对话中情绪识别的弱点

Exposing Weaknesses in Emotion Recognition in Conversations

模型评测评测方法与指标

摘要

对话中的情绪识别(ERC)旨在识别多轮对话中说话者的情绪。准确的情绪识别可以支持广泛的应用,包括善解人意的对话智能体、心理健康支持和教育技术。虽然许多最近的方法依赖于特定于任务的微调,但此类模型可能会利用特定于数据集的线索。 ERC 中的一个核心但很少受到质疑的假设是,每个话语都可以分配一个明确的情感标签。为了研究这个假设,我们在零样本环境中使用大型语言模型(LLM)来研究 ERC,同时将之前的对话轮次作为上下文。我们表明,总体指标掩盖了系统性故障。错误集中在包含否定、感叹和感叹词的话语上。这种模式在所有评估的模型中都是一致的,表明基准存在局限性,而不是模型特定的弱点。一项涉及四名人类注释者的受控重新注释研究支持了这一发现:仅在 35% 的案例中观察到强烈的一致性,中性话语在高一致性实例中占主导地位,而许多情感类别则属于低一致性状态。这些发现表明,许多明显的模型错误反映了真正的注释歧义,而不是不良的情感理解。因此,标准的单标签评估是不够的。为了解决这一限制,我们引入了一个 LLM-as-Judge 框架,该框架根据每种情绪在对话环境中的合理性独立评估每种情绪,而不是强制执行单标签决策。

暴露对话中情绪识别的弱点:论文配图
图 1:来自 MELD 的 ERC 中注释歧义的示例,其中情感解释取决于隐含意图并允许多个有效标签。