论文

解码情感细微差别:通过分层情感推理和对比判别剪枝增强 MLLM

Decoding Affective Nuances: Enhancing MLLMs via Hierarchical Emotion Reasoning and Contrastive Discriminative Pruning

模型推理推理策略与问题分解

摘要

虽然多模态大语言模型(MLLM)在客观理解任务中表现出了卓越的能力,但它们在情感推理方面的表现仍然远远低于人类标准。我们将其归因于一个核心能力差距:MLLM 很难根据细粒度的视觉证据可靠地区分语义上接近的情绪,这可以分解为两个限制:1)归因不足。传统MLLM的全局推理范式严重淡化了细粒度的情感线索,其中微妙的情感状态通常被隐式编码,从而在复杂场景中产生情感误判。 2)歧视不足。现有的方法只能识别通常与情绪相关的区域,无法区分语义相似的情绪之间的判别区域,从而导致情绪判断不明确。为了克服这些限制,我们提出了一种免训练的推理时间优化框架,名为解码情感细微差别(DAN)。具体来说,我们提出了一种分层情感推理链(HERC),通过协调细粒度的场景/对象级线索并执行软门推理来增强归因不足。此外,为了区分语义上接近的情绪,我们设计了一种对比判别视觉修剪(CDVP),它隔离判别性视觉标记,通过计算相似情绪的注意力分布之间的绝对差异来推理最终的情绪类别。多个基准测试的表现表明,DAN 在不消耗额外训练资源的情况下显着提高了对情感细微差别的辨别力,特别是在包含 25 个细粒度情感类别的 WebEmo25 数据集上使用 Qwen3-VL-8B-Instruct 实现了 +10.47% 的改进。