论文
思想的时间树:用于长视频理解的推理引导视觉线索搜索
Temporal Tree of Thought: Reasoning-Guided Visual Cue Search for Long-Video Understanding
摘要
由于上下文长度有限,长视频理解对于多模态 大语言模型 (MLLM) 来说仍然具有挑战性。均匀采样可能会错过关键时刻,而基于代理的帧视频理解方法通常独立评估帧,忽略视频的时间组织。理想情况下,证据选择应该模仿人类回答有关长视频的问题的方式:首先从全局上下文中定位相关片段,然后放大局部对象和细节。我们提出了 Temporal Tree of Thought T^3,这是一个用于自适应从粗到精长视频理解的 无需训练 框架。 T^3 通过递归时间约束聚类构建一个与问题无关的分层时间树,其中每个节点代表一个具有信息关键帧的连续片段。在推理过程中,T^3 执行答案-检索-探索循环:它对粗略的代表性框架进行推理,在证据不足时生成搜索语句,并扩展相关分支以获取更细粒度的证据。此过程自适应地将搜索目标从时间区域转移到特定对象和视觉细节,以帮助视频理解。在VideoMME、LongVideoBench和LVBench上的实验表明,在相同的帧预算下,T^3分别将Qwen2.5-VL-7B提高了0.5%、4.6%和4.4%,证明了结构化时间推理的有效性。