论文

学习拒绝:多式联运中的行动拒绝 大语言模型

Learning to Deny: Action Denial in Multimodal Large Language Models

模型评测基准与评测资源

摘要

多模态 大语言模型 (MLLM) 具有快速先进的视频理解能力,可在标准基准测试中实现强大的零镜头和少镜头识别。然而,尽管有很强的上下文线索,但他们通过识别活动何时没有发生来否认某项行动的能力在很大程度上仍未被探索。我们引入了 UCF101-AD,这是一个由配对的“动作-存在”和“动作-拒绝”剪辑组成的大型基准,旨在评估这种拒绝能力。 UCF101-AD 中的每个负面视频都保留了与正面视频相同的上下文和动作线索,包括人物、物体和位置,但定义动作本身明显不存在。对 20 个最先进的 MLLM 的评估揭示了一致的失败:在积极行动类别上超过 85% 准确率的模型在其否定行动类别上的准确率低于 50%,这表明强烈倾向于肯定看似合理的行动,而不是验证它们是否确实发生。这暴露了现代视频理解中的一个关键盲点:无法因果推理运动是否确实发生。为了探讨这个问题,我们探索了一种因果图公式 CausalAct,它通过链接上下文、交互和运动的自然语言提示来表达场景结构。纳入此类因果线索可以大大减少误报,这表明否认是一种可以学习的推理技能。 UCF101-AD 为诊断和改进多模态模型中的因果推理提供了新的视角。数据集和相关代码:https://github.com/raiyaan-abdullah/Learn-to-Deny。