论文
TempoGround:具有视觉语言模型的状态感知流视觉基础
TempoGround: State-Aware Streaming Visual Grounding with Vision-Language Models
摘要
视觉基础将语言所指映射到空间目标,并且对于视觉语言模型的开放词汇感知至关重要。现有方法在单帧和基于视频的视觉基础上取得了实质性进展,但在流输入下,它们仍然面临身份漂移、跨帧不一致和部分遮挡下脆弱定位的问题。为了解决这些问题,我们提出了 TempoGround,这是一个 VLM 原生框架,可检测跨帧对象对应并显式建模对象存在状态,从而在流输入下实现准确且一致的视觉基础。关键是由状态感知跨帧对应引导的课程预测机制:TempoGround 解析 2D 实例关联,预测每个对象是否新进入、继续进入或离开视图,解码 2D 框,然后将其提升为相机帧 3D 框。由于仅 词元级 监督无法捕获流式定位的几何目标,因此我们进一步引入了流式定位强化(SGR),它通过可验证的定位、身份和一致性奖励来优化 TempoGround,共同增强持久定位和时间一致的预测。我们精心设计了三阶段训练策略,并在大规模数据上训练 TempoGround。我们在多个具有挑战性的基准上评估因果流输入下的视觉基础:TempoGround 将 F1_2D@0.5 和 F1_2D@0.95 平均提高 4.4 和 0.5,将 F1_3D@0.25 和 AP_3D 分别提高 6.2 和 7.5。这些结果表明 TempoGround 为流输入下的视觉基础提供了实用的基础。