论文

CALM-AH:经过 ABAW11 校准的多模态集成,具有可靠性门控多专家共识,用于视频级矛盾和犹豫识别

CALM-AH: An ABAW11-Calibrated Multimodal Ensemble with Reliability-Gated Multi-Expert Consensus for Video-Level Ambivalence and Hesitancy Recognition

模型推理推理验证与自校正

摘要

矛盾和犹豫 (A/H) 是微妙的行为状态,可以通过语言、声音、面部活动和其他非语言线索来表达。 ABAW11 A/H 视频识别挑战赛要求系统为每个自然采访视频分配一个二进制 A/H 标签。使用 Macro-F1 测量性能,因此 A/H 和 No-A/H 样本的识别具有同等重要性。我们提出了 CALM-AH,一种结合了文本、声学、视觉和派生行为统计特征的多模态集成。我们构建了这些特征分支的 15 个非空组合。对于每个组合,我们使用验证二元交叉熵选择三个分类器系列中最好的一个,并优化其验证 Macro-F1 的决策阈值。由此产生的二元决策使用从 BROTHER 传输的固定硬投票权重进行组合。我们进一步介绍了可靠性门控多专家共识(RG-MEC),这是一种锚点保留决策级集成,它将初始预测与三个互补校正专家相结合:CALM-AH、AffectGPT 和基于 GPT 的语义验证器。初始系统提供默认预测。只有当所有三位校正专家一致支持同一个替代类时,它的标签才会被覆盖;否则,保留锚点预测。这种一致门控设计限制了孤立专家错误的影响,同时在特定任务、多模态情感和语义语用证据完全一致时允许双向纠正。在参与者不相交的 ABAW11 数据集上,CALM-AH 的 Macro-F1 达到 0.7525,完整的 RG-MEC 系统达到 0.7771。