论文

通过秒级跟踪和强化学习验证,利用多模态大型模型实现高效时空定位

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

应用与实践视觉感知与空间理解

摘要

长视频中的时空定位需要精确的时间定位和基于自然语言查询的强大的对象跟踪。虽然最近的视觉语言模型(VLM)显示出强大的推理能力,但直接将逐帧推理应用于长序列的计算成本昂贵且不稳定。我们提出了一种实用的流程,从帧级跟踪转变为秒级跟踪,并执行跨秒平滑以保持连续性,同时减少序列长度。为了改进推理监督,我们使用先进的多模态模型来合成思维链式轨迹,以进行时间定位和目标选择,并用 真值 注释替换生成的时空坐标,以避免噪音监督。我们使用基于 $t\_\mathrm{IoU}+mv\_\mathrm{IoU}$ 的验证器通过强化学习进一步优化策略。跨多种 FPS 设置的实验表明,我们的方法在效率和定位质量之间实现了强有力的权衡。