论文

跟随线索,框定真相:开放词表多模态情感识别中的混合证据演绎推理

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

模型训练强化学习

摘要

开放词表多模态情感识别(OV-MER)本身极具挑战,因为含混的多模态线索往往源于各不相同且未被观测到的情境动态。多模态大语言模型(MLLM)虽提供广泛的语义覆盖,但其性能常受制于对主导数据先验的过早承诺,导致次优启发式,忽视跨模态中关键且互补的情感线索。我们认为,有效的情感推理不能止于表层关联,而需要综合多条基于证据的理由、从多样的潜在视角调和这些观察,从而重建细腻的情绪状态。我们提出HyDRA,一种混合证据演绎推理架构,将推理形式化为「提出—验证—决策」协议。为内化这一溯因过程,我们采用带分层奖励塑形的强化学习,使推理轨迹与最终任务表现对齐,确保其能最佳地调和观测到的多模态线索。系统评估验证了我们的设计选择,HyDRA持续优于强基线——在含混或冲突场景中尤为突出——同时提供可解释的诊断性证据轨迹。

跟随线索,框定真相:开放词表多模态情感识别中的混合证据演绎推理:论文配图
图 1:Hydra 概述。 (A) 提议-验证-决定推理协议:给定多模态输入,HyDRA 提出多个潜在上下文假设,通过与明确引用的证据约束比较来裁决它们,并输出最合理的情绪集。 (B) 使用 GRPO 和分层奖励塑造学习 HyDRA:对于每个输入,我们以 <hyp>-<think>-<ans> 格式对一组结构化轨迹进行采样,用六个奖励对它们进行评分,计算组相对优​​势,并更新策略以支持证据封闭和模糊情况下的稳健决策。文本基本原理以数据集提供的经人工验证的文本化多模态线索 (ObsG) 为基础,并通过与真实线索描述的语义对齐来强制执行。