论文

LG-GER:通过多模态证据进行语言引导的群体情绪识别 蒸馏

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

摘要

从单个图像推断一群人的集体情绪状态,这是一项称为群体情绪识别 (GER) 的任务,需要整合空间分布的线索,例如面部、姿势、交互和场景上下文。当前的方法依赖于检测器驱动的多流管道。这些仅通过图像级监督进行训练,缺乏关于哪些区域重要或每个区域贡献多大的指导。我们提出了 LG-GER,一种语言引导的 蒸馏 框架,它使用多模态 大语言模型 (MLLM) 为训练图像生成密集的、基于空间的证据,即与情感信号和置信度分数配对的边界框。这种结构化证据通过四个互补损失被提炼成单一视觉语言模型(VLM)主干:分类、区域文本基础、空间情感和空间置信度回归。由此推断,LG-GER 不需要检测器,不需要 MLLM,也不需要多流融合,使得 GER 适合实时和资源受限的部署。 LG-GER 已在两个基准 GER 数据集(GroupEmoW 和 GAF~3.0)上进行了评估,与需要检测和推理时多流处理的最先进方法相比,取得了有竞争力或更好的结果。