论文
情绪识别失败可能来自读出而非视觉感知
The Failure Is in the Readout: Fine-Grained Emotion Recognition Benchmarks Measure Elicitation, Not Perception
摘要
细粒度情绪识别支持治疗工具和社交机器人,但人脸数据有隐私问题。EmoNet-Face-HQ以生成肖像及专家40类评分应对,粒度远高于常见六至八种情绪。其原协议下VLM表现较差,并据此认为需要专用微调EIF模型。我们保持图像、分类和评分,只改变答案读出:每类别一次二元查询,从logits读取概率而非生成答案,现成VLM即可匹配或超过EIF。专家最可靠的五类一致性为 $κ_w=0.468$。生成式读出时,11个开放模型没有一个区间完全高于该锚点,得分0.268—0.486;验证式概率读出时全部显著超过,达到0.507—0.586,三个还显著超过EIF Small的0.551及Large的0.534。收益来自连续分级概率,不只是是非提问:将同一概率阈值化损失平均收益的142%,降到0.254—0.423,低于生成式。真实FACES照片复现效果较弱且混合;通过有效性门槛的十模型中六个改善,三个中性到正向,一个负向,说明效果并非只存在于合成数据。