论文

StateTrace:长视频中隐藏状态时空推理的以对象为中心的框架

StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

摘要

现有的VLM在视频理解方面取得了很强的性能,但当目标物体变得不可见时,它们在长视频时空推理上遇到了困难,常常将“不可见”误认为“未知”。我们将这一挑战定义为隐藏状态时空推理:从上下文交互中推断长时间不可见间隔期间的对象状态。为了解决这个问题,我们提出了 StateTrace,这是一种新颖的以对象为中心的框架,它为 VideoLLM 提供了一种用于长视频中隐藏状态推理的显式机制。 StateTrace 构建了一个可重用的时空状态存储器,将对象轨迹、对象间关系和状态转换事件组织到结构化推理基础中。在推理时,它检索与问题相关的状态演化轨迹并将其转换为紧凑的推理线索,使模型能够明确推理对象为何消失、其状态在不可见时如何演化,以及该状态是否应在查询时持续存在。我们进一步构建了 HSR-Bench,这是一个隐藏状态推理的诊断基准,包含来自 1,384 个独特视频的 1,427 个视频 QA 样本。跨多个 VideoLLM 的大量实验表明,StateTrace 持续提高公共基准和 HSR-Bench 上的性能(例如,将 HSR-Bench 上的 VideoLLaMA3 从 39.6 提高到 64.2)。