论文
SpaTime:面向时空推理的流式视觉语言模型
SpaTime: Streaming Vision-Language Models for Spatio-temporal Reasoning
摘要
体现的智能体必须在视频到达时推理 3D 空间,一旦观察到足够的场景就回答问题。结合 3D 几何先验的 VLM 实现了强大的空间推理,但它们离线运行,即在产生答案之前必须提供完整的视频。流式 VLM 因果地处理帧并自行决定何时响应,但它们缺乏明确的 3D 表示。我们提出了 SpaTime,一种流式 VLM,它仅使用迄今为止观察到的帧,在每一帧将因果几何 token 融合到语言模型中。为了监督模型何时回答,我们提出了响应时间损失,将每帧响应概率映射到可微的预期响应时间,并惩罚与地面实况帧的距离。为了进行评估,我们构建了 StreamVSTI-Bench 和 StreamVSI-Bench,这是 VSTI-Bench 和 VSI-Bench 的流式改编。在 StreamVSTI-Bench 上,与最强的流媒体基线相比,SpaTime 的总体准确率达到 49.2%,平均响应时间误差降低了 66%。
