论文
ActFER:通过主动工具增强视觉推理进行代理面部表情识别
ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning
摘要
多模态 大语言模型 (MLLM) 的最新进展为面部表情识别 (FER) 创造了新的机会,使其超越纯粹的标签预测,转向基于推理的情感理解。然而,现有的基于 MLLM 的 FER 方法仍然遵循被动范式:它们依赖于外部准备的面部输入,并对固定的视觉证据进行单遍推理,不具备主动面部感知的能力。为了解决这一限制,我们提出了 ActFER,这是一种代理框架,它将 FER 重新表述为主动视觉证据获取,然后进行多模态推理。具体来说,ActFER 动态调用面部检测和对齐工具,有选择地放大信息丰富的局部区域,并通过视觉思维链对面部动作单元 (AU) 和情绪进行推理。为了实现这种行为,我们进一步开发了实用校准 GRPO (UC-GRPO),这是一种针对代理 FER 量身定制的强化学习算法。 UC-GRPO 使用基于 AU 的多级可验证奖励来强化监督,使用查询条件对比效用估计来实现本地检查的样本感知动态贡献分配,以及情感感知 EMA 校准来减少嘈杂的效用估计,同时捕获情感明智的检查倾向。该算法使 ActFER 能够了解本地检查何时有益以及如何对所获取的证据进行推理。综合实验表明,使用 UC-GRPO 训练的 ActFER 始终优于基于 MLLM 的被动 FER 基线,并显着提高了 AU 预测准确性。