论文

AffectOmni:面向社交与艺术场景的RL可验证、以人为中心的像素证据定位情感推理

AffectOmni: RL-Verifiable People-Centric Grounded Affective Reasoning for Social and Art-Related Scenes

模型训练强化学习

摘要

多模态大语言模型(MLLM)在VQA和场景理解上表现强劲,但情感推理仍易受捷径行为影响。模型可能在忽视以人为中心的线索(如微表情和肢体语言)的情况下预测出正确答案,这削弱了可追溯性和外部可验证性。先前的强化学习方法主要奖励上下文或逻辑连贯性,而未显式强制对人类证据的关注。此外,LLM作为评审(LLM as a Judge)的打分常受分数聚类困扰,降低了奖励的区分度。我们提出AffectOmni,一个经GRPO训练的可验证情感推理框架。AffectOmni引入People Focus和时序顺序(Temporal Order)奖励,以鼓励以人为中心的证据选择和时序结构化推理,并采用组内比较评分以产生更稳定、更具区分度的奖励信号。在验证方面,一个思维总结器(Thinking Summarizer)将自由格式的推理理由转换为可执行的证据指令,再经由SAM3将其锚定到像素级证据区域,从而在训练环之外提供外部可审计的接口。在IntentBench、Daily Omni和WorldSense上的实验显示,相比开源7B规模基线取得一致提升,包括情感识别提升4.66%、时序敏感任务提升14.29%。代码见 https://github.com/eliot127825-rgb/AffectOmni_nobody。

AffectOmni:面向社交与艺术场景的RL可验证、以人为中心的接地情感推理:论文配图
图2:AffectOmni 框架。该管线由三个阶段组成。(1) LOCATE 采用以人为中心的奖励(RpplR_{\mathrm{ppl}}、RtmpR_{\mathrm{tmp}})进行 GRPO 训练,并结合比较打分,以引导基于证据的推理。(2) REASON 生成结构化输出,并通过 Thinking Summarizer 将推理链压缩为最小证据包(MEP)。(3) VERIFY 使用 SAM3 将 MEP 落实到像素级掩码,从而支持事后审计证据主张能否在视觉输入中被定位。星号标示我们的关键贡献。我们在第 V 节进一步评估验证模块。