论文

MoHallBench:视频中运动幻觉的基准 大语言模型

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

模型评测基准与评测资源

摘要

视频大语言模型(VideoLLM)在视频理解方面表现出了巨大的进步,但他们仍然遭受与视觉证据不一致的幻觉的困扰。现有的基准主要集中在物体幻觉或粗略动作感知上,而未充分探索视频特定的关键问题:运动幻觉,其中模型推断视频中不存在的人类运动。我们推出了 MoHallBench,这是在 VideoLLM 中诊断运动幻觉的基准。 MoHallBench 系统地评估了幻觉的三个主要来源:共现先验、顺序推理和相似性混淆。它包含 11,306 个视频剪辑和 40,493 个问答对,涵盖二元选择、多项选择和生成设置。我们进一步引入了具有偏见感知指标的双向提问协议,以减少二元评估中的肯定偏见。最近对十个开源 VideoLLM 进行的实验揭示了动作识别和幻觉抵抗之间的明显脱钩,因为在积极动作识别上表现良好的模型通常在对抗性消极动作识别上表现不佳。在所有设置中,顺序推理幻觉是最严重的,这表明当前模型倾向于从部分运动线索过度推断预期结果。我们的分析进一步证实,更强的先验和更细粒度的相似性会大大放大幻觉。我们希望 MoHallBench 能够促进未来对 VideoLLM 中运动幻觉的评估和缓解。