论文

SRE-FER:区域残余证据学习,用于减轻细粒度面部表情识别中的局部证据稀释

SRE-FER: Regional residual evidence learning for mitigating local evidence dilution in fine-grained facial expression recognition

模型训练监督微调与指令调优

摘要

细粒度的面部表情识别(FER)取决于捕捉区分相邻情绪的微妙肌肉线索。然而捕捉这些线索却面临着两难的境地。基于检测器的方法依赖于脆弱的地标管道,而我们发现,在传统的全局读数下直接转移诸如 DINOv3 之类的基础模型可能会导致局部证据稀释:早期的全局聚合会消除稀疏的肌肉信号,并在恐惧/惊讶和悲伤/中性等类别之间留下持续的混乱。为了恢复这些证据,我们提出了 SRE-FER,一种读出级区域残留证据学习框架。其核心模块 RERA 添加了零初始化残差 logits,可细化类边界,同时保留主干的全局预测。训练时动作单元 (AU) 指导使用基于面部动作编码系统 (FACS) 的解剖先验将区域特征引导至表情相关区域,无需在推理时使用外部面部管道。可选的完整设置进一步路由特定于样本的非冗余词元。在三个基准测试中,SRE-FER 在 RAF-DB 上达到 92.76%,在 FERPlus 上达到 91.32%,在 AffectNet-7 上达到 67.78%,与现有 FER 方法相比,表现出极具竞争力的性能。