论文

HPP:通过解耦感知和推理来理解长视频的分层程序化探索

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

智能体系统Agent 工具调用

摘要

理解长视频需要对复杂的远程时空动态进行细粒度的感知和多步骤、高阶推理。视觉语言模型 (VLM) 将视频帧编码为视觉标记,并尝试在单个前向传递中潜在地执行感知和多步骤规划。然而,这种耦合公式受到 LLM 在其潜在表示中发现和执行多步骤策略的有限能力的瓶颈。为了解决这个瓶颈,我们提出了分层程序化探测(HPP),这是一个框架,通过将长视频理解重新表述为对分层分段视频的迭代、程序化探索,将语义感知与高阶时间推理分离。具体来说,具有编码能力的 LLM 在交互式编码环境中规划并执行多步骤策略,探测视频中的信息并调用 VLM 进行按需本地化感知。为了使长视频的探测变得容易处理,我们引入了三个组件:信息密度感知的分层分割、后期交互语义检索和用于从粗到细时间定位的结构化探测函数。我们在 LongVideoBench 上验证了 HPP,这需要细粒度的感知和远程关系推理,并表明通过迭代编程探测将两者解耦可以产生巨大的收益。 EgoSchema、VideoMME 和 MLVU 的进一步结果证明了我们的方法在各种长视频基准测试中的有效性。