论文

Chain-of-Glimpse:用于视频理解的搜索引导渐进式基于对象的推理

Chain-of-Glimpse: Search-Guided Progressive Object-Grounded Reasoning for Video Understanding

模型推理推理策略与问题分解

摘要

视频理解需要跨帧对语义上有区别的视觉对象进行识别和推理,但现有的与对象无关的解决方案很难有效地处理随时间推移的大量对象变化。为了解决这个问题,我们引入了 Chain-of-Glimpse,这是一种搜索引导的渐进式基于对象的推理框架,该框架将每个推理步骤明确锚定到特定的视觉证据区域,从而实现组合和多步骤决策。从形式上来说,Chain-of-Glimpse 将视频推理制定为一个循序渐进的过程,围绕与任务相关的视觉对象逐步构建空间定位轨迹,从而减轻对显着性驱动线索的过度依赖。具体来说,Chain-of-Glimpse 具有一个搜索引导控制器,通过强化学习进行优化,并具有显着激励视觉定位能力的格式奖励,以迭代地定位视觉证据区域并形成可靠的推理轨迹,从而产生准确且可解释的多步骤决策。对域内 NExTQA 和域外 Video-Holmes、CG-Bench Reasoning 和 VRBench 基准的广泛评估表明,Chain-of-Glimpse 在不同的视频推理任务中具有一致的性能增益、鲁棒性和泛化性。