论文
DSPO:具有多样性意识的主观策略优化,用于稳健的情感推理
DSPO: Diversity-aware Subjective Policy Optimization for Robust Emotional Reasoning
摘要
强化学习显着提高了 MLLM 的复杂推理能力。然而,流行的强化学习算法在情感推理任务中遭遇严重失败。这些方法严重依赖于确定性的硬标签监督和逐点孤立评估,与人类情感固有的主观性和持续分布性产生了根本性的差距。此外,与明确的物理对象不同,情绪状态深深地隐含在视觉线索中。这种抽象的性质加剧了 MLLM 的视觉幻觉,导致出现看似合理但毫无根据的情感证据。为了解决这些限制,我们提出了多样性感知主观策略优化(DSPO),这是一种强化学习框架,可以共同促进主观情感覆盖和视觉基础。首先,我们通过将带注释的情感的词汇先验与图像特定的上下文信息相结合,在 VAD 空间中构建基于上下文的情感分布先验。基于此先验,我们引入了分布对齐的情感多样性奖励(DEDR),它衡量rollout中每个候选情感的留一边际贡献。 DEDR 奖励那些将预测的情感集更接近基于上下文的先验的候选者,从而保留合理的主观解释,而不鼓励不受约束的分散。我们进一步开发了反事实视觉干预门控(CVIG),它掩盖了推理过程中突出显示的视觉区域,并使用由此产生的候选概率变化来减少不受视觉证据支持的解释的权重。大量实验表明,DSPO 在多个公共基准测试中实现了最先进的性能,特别是在跨域性能方面,即平均跨域精度比 EMO-R3 提高了 +10.8%。