论文
用于视频级矛盾和犹豫识别的交互流的知识引导多模态推理
Knowledge-Guided Multimodal Reasoning over Interacting Streams for Video-Level Ambivalence and Hesitancy Recognition
摘要
矛盾心理和犹豫(A/H)是在延迟或放弃健康行为改变之前出现的相互冲突的情感状态。在视频层面识别 A/H 很困难,因为信号源自面部、声音、语言和身体形态之间的分歧,并且在个体之间表现不同。拟议的 PRISM-AH(针对多模态矛盾/犹豫识别的交互流的预测推理)是将 A/H 视为随时间展开的多模态冲突的框架。冻结的视觉、音频和文本编码器被对齐到短时间窗口中,并传递到一个轻量级流模型,该模型对跨模式失调进行评分,预测每个下一个窗口以暴露犹豫惊喜信号,发现行为原型,并以参与者元数据为条件。密集的窗口级注释作为辅助目标来监督模型,并且针对宏 F1 校准决策阈值。然后,知识引导的 大语言模型 使用数据集的专家提示分类法对结构化证据进行推理,并且仅当验证性能提高时,其结论才会在后期融合。在 525 个视频的标记公共测试分区上,PRISM-AH 的宏 F1 为 0.6133,而报告的零样本基线为 0.2827。推理增益经过验证以从验证转移到更大的测试分区。