论文
用物理信号检验视频推理的时空定位能力
Grounding Video Reasoning in Physical Signals
摘要
物理视频理解不只是正确说出事件名称。模型可能依据文本规律回答倾倒、滑动或碰撞问题,却无法在时间或空间上定位事件。我们构建基于物理信号的视频理解基准,将V-STaR的“是什么—何时—何地”结构扩展到四个视频来源、六个物理领域、三种提示系列(physics、vstar_like、neutral_rstr)和四种输入条件(原始、打乱、消融、帧遮蔽)。基准包含SSV2、YouCook2、HoloAssist与Roundabout-TAU的1560个基础视频片段。每个片段先转为具有时空依据的统一事件记录,再由该记录生成三种查询。时间与空间目标在提示系列间共享,非物理系列则由同一记录确定性生成符合各自形式的语义a_what目标。跨模型与提示系列,physics总体表现最强,vstar_like提供最清晰的非物理语义对照,neutral_rstr则是更困难的模板化控制条件。模型对提示系列的鲁棒性具有选择性,扰动收益主要集中在原始表现较弱的案例,空间定位在各设置下最薄弱。因此,视频问答基准除总体准确率外,还应报告有物理依据、考虑提示与扰动的诊断结果。