论文
从先验到感知:在物理现实中扎根视频-LLM
From Priors to Perception: Grounding Video-LLMs in Physical Reality
摘要
视频 大语言模型 (Video-LLM) 在一般视频理解方面表现出色,但通常基于事件预期而不是观察进行物理判断。我们发现,尽管有明显矛盾的视觉证据,他们不仅将物理上不可能的事件合理化,而且还在物理上合理但违反直觉的场景中错误地报告了预期结果。我们对这些失败提供了第一个统一的解释,即语义先验优势(SPD):语义期望压倒了相互冲突的视觉证据。为了诊断和克服这些故障,我们引入了 PriorPair,这是一种高保真配对视频基准,涵盖八个物理类别的冲突。其类别导向的构造将先验对齐的事件与语义匹配但先验冲突的对应事件配对。我们进一步提出了物理锚定推理器(PhyAR),一种轻量级训练框架。其视觉锚定推理链将物理归因和判断建立在明确的视觉观察中,而配对数据绑定则通过配对监督加强对决定性事件差异的学习。具有 PhyAR 的标准 LoRA 微调 显着改善了物理推理,并减少了不同 Video-LLM 主干网之间先验驱动的判断偏差,无需进行架构修改。这些成果延伸到外部物理基准,同时在很大程度上保留了一般视频理解。