论文

SpaTime:面向时空推理的流式视觉语言模型

SpaTime: Streaming Vision-Language Models for Spatio-temporal Reasoning

模型架构混合架构

摘要

体现的智能体必须在视频到达时推理 3D 空间,一旦观察到足够的场景就回答问题。结合 3D 几何先验的 VLM 实现了强大的空间推理,但它们离线运行,即在产生答案之前必须提供完整的视频。流式 VLM 因果地处理帧并自行决定何时响应,但它们缺乏明确的 3D 表示。我们提出了 SpaTime,一种流式 VLM,它仅使用迄今为止观察到的帧,在每一帧将因果几何 token 融合到语言模型中。为了监督模型何时回答,我们提出了响应时间损失,将每帧响应概率映射到可微的预期响应时间,并惩罚与地面实况帧的距离。为了进行评估,我们构建了 StreamVSTI-Bench 和 StreamVSI-Bench,这是 VSTI-Bench 和 VSI-Bench 的流式改编。在 StreamVSTI-Bench 上,与最强的流媒体基线相比,SpaTime 的总体准确率达到 49.2%,平均响应时间误差降低了 66%。

SpaTime:面向时空推理的流式视觉语言模型:论文原图
图 2:SpaTime 管道。图 (a) 展示了整个流程。每个帧都由冻结的视觉编码器和冻结的因果几何编码器进行编码,然后(b)轻量级投影仪将几何 token 与视觉 token 对齐,并通过逐元素加法进行融合。在 (c) 中,响应时间损失 ${\mathcal{L}}_{\text{time}}$ 将预测响应时间与实际情况对齐。