论文
顺序很重要:LVLM 作为图像序列中时间推理的法官
Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences
摘要
随着生成多媒体从静态图像合成发展到复杂、交错的视觉叙事,一个基本瓶颈出现了:判断危机。虽然人类的感知自然地综合了故事的时间和逻辑流程,但自动评估系统在很大程度上对顺序连续性仍然“盲目”,常常无法区分连贯的叙述和语义上混乱或矛盾的序列。这项工作确定了当前多模式评估范式中的一个关键结构性差距,认为对大视觉语言模型(LVLM)作为法官的依赖从根本上受到架构偏见的限制。我们的分析揭示了深刻的性能二分法:虽然模型在孤立的逐点评分中可能表现得很好,但当需要执行时间顺序的成对区分时,它们会遭受灾难性的崩溃。我们证明这不仅仅是一个数据稀缺问题,而且是一个结构性问题。通过一系列的诊断探针,我们发现了系统的位置不对称,特别是首因效应和新近效应,其中模型对故事的判断受到框架放置的显着影响,通常比其语义一致性影响更大。这些偏见可能源于因果屏蔽和旋转嵌入,表明当前基于 Transformer 的判断本质上不适合长形式视觉推理。通过暴露这些盲点,我们挑战多媒体社区超越以快照为中心的指标,而是开创时间感知评估范例,将视觉序列视为统一的逻辑结构,而不是无序的帧集合。