论文
重新思考特征工程和学习策略在少样本隐藏情感识别中的作用
Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition
摘要
在本文中,我们介绍了我们团队 XInsight Lab 开发的解决方案,该解决方案在第四届 EI-MIGA-IJCAI 挑战赛的 Track 3 中获得第一名,测试精度为 0.76923。为了解决长视频中隐含情感证据薄弱且稀疏的挑战,本文扩展了之前竞赛的获胜解决方案,并提出了一种紧凑的多模态时间建模框架。该框架集成并评估了多源特征的效果,包括2D/3D骨骼、面部表情Blendshapes、DINOv2/v3视觉基础模型、X-CLIP视频特征和Gemini语义先验。在架构上,我们提出了一种交叉注意力机制,利用静态姿态特征(表示为 Base)作为查询,动态微运动差分特征(表示为 Offset)作为键和值。通过捕获局部相对速度,该机制消除了与个体体型和身份相关的静态偏差。同时,采用基于多实例学习的自适应池方法来提取瞬时情绪,同时抑制长序列中的背景噪声。最后,论文揭示了通用视觉基础模型在微观动态任务中的表征崩溃现象,并分析了网络因捷径学习和死记硬背而陷入公共排行榜驱动的伪泛化的深层机制。