论文
为什么视觉语言模型难以识别人类情感?
Why Do Vision Language Models Struggle To Recognize Human Emotions?
摘要
理解情绪是智能系统与人类交互的基本能力。视觉语言模型(VLM)在过去几年中在许多视觉任务中取得了巨大进步,可能为理解情感提供有前途的解决方案。然而,令人惊讶的是,即使是最复杂的当代 VLM 也难以识别人类情感,甚至无法超越专门的仅视觉分类器。在本文中,我们提出了“为什么 VLM 难以识别人类情感?”的问题,并观察到面部表情识别 (DFER) 本质上连续且动态的任务暴露了两个关键的 VLM 漏洞。首先,情感数据集本质上是长尾的,而用于预训练 VLM 的网络规模数据加剧了这种头类偏见,导致它们系统地将罕见的、代表性不足的情感归入常见类别。我们提出了替代抽样策略,以防止偏向共同概念。其次,时间信息对于理解情绪至关重要。然而,VLM 无法表示密集帧序列上的时间信息,因为它们受到上下文大小和可以放入内存的标记数量的限制,这对情感识别提出了明显的挑战。我们证明,VLM 中使用的稀疏时间采样策略本质上与微表情(0.25-0.5 秒)的短暂性质不一致,而微表情通常是最关键的情感信号。作为一种诊断探针,我们提出了一种多阶段上下文丰富策略,该策略首先将“中间”帧中的信息转换为自然语言摘要,从而利用这些信息。这种丰富的文本上下文与稀疏关键帧一起作为 VLM 的输入提供,防止过多视觉数据的注意力稀释,同时保留情感轨迹。