论文
STORM:视频语言模型中时空推理的内化建模
STORM: Internalized Modeling for Spatial-Temporal Reasoning in Video-Language Models
摘要
许多视频推理任务需要跟踪运动、时间顺序和跨帧的视觉状态演变。基于大型视觉语言模型 (LVLM) 的现有方法通常通过文本思维链 (CoT)、关键帧选择、重复帧重新插入或外部工具使用来外部化推理,从而解决这一挑战。虽然有效,但此类管道增加了推理时间延迟和工程复杂性,并且它们迫使时间视觉证据序列化为文本或从帧重复重新编码。受到视觉推理可以在语言表达之前隐式发生的直觉的启发,我们提出了 STORMS(通过内化建模进行时空推理),这是一个两阶段框架,教导 LVLM 通过有界连续潜在轨迹而不是显式文本 CoT 进行推理。在第一阶段,STORMS 将潜在标记与源自生成视频的思想视频表示相结合,将潜在状态扎根于动态视觉证据中。在第二阶段,模型通过仅答案监督进一步训练,鼓励推理过程内化,无需逐步注释。生成的思维视频仅在训练期间使用;在推理时,STORMS 执行有界潜在轨迹采样,无需重新生成视频、重新插入帧或调用外部视觉工具。 VideoMME、MVBench、TempCompass 和 MMVU 上的实验表明,与工具或基于视频生成的推理管道相比,STORMS 提高了视频推理准确性,同时大幅降低了推理开销。