论文

RACER:通过反思查询与工具检索选择长视频关键帧

RACER: Reflective Agent Coupling Query Interpretation and Tool-Based Retrieval for Frame Selection in Long Video Understanding

上下文与知识智能体系统上下文工程检索增强Agent 工具调用

摘要

视频大语言模型 (Vid-LLM) 通过对选定帧进行推理,擅长执行各种视频语言任务。然而,长视频的帧选择仍然具有挑战性,因为它需要在给定复杂查询的情况下从大型候选池中检索分布在各个片段上的相关帧。本文从任务分解的角度研究了长视频帧选择的主要方法,确定了两个关键挑战:基于相似性的方法中的查询理解差距和基于判断的方法中的解释-选择差距。为了解决这些问题,我们提出了 RACER,这是一种免训练的反射式 Agentic 框架,它将长视频帧选择分解为由轻量级 Vid-LLM 驱动的查询解释和由用作检索工具的嵌入模型支持的证据定位。具体来说,Vid-LLM 仅负责将复杂查询重新表述为子查询,使隐式信息需求变得明确,从而缩小查询理解差距。同时,检索工具利用这些子查询来定位相关证据,减轻了 Vid-LLM 的直接框架选择,从而解决了解释-选择差距。最后,检索到的帧被反馈到 Vid-LLM 进行子查询细化,形成一个反射循环,迭代地改进查询解释和帧选择。跨多个基准测试的实验表明,RACER 持续改善长视频理解。值得注意的是,即使使用功能有限的组件,RACER 也能实现有效的帧选择,这表明 Agentic 集成使这些组件能够增强功能更强大的 Vid-LLM。

RACER:通过反思查询与工具检索选择长视频关键帧:论文原图
图 3:RACER 概述。 RACER 从 (a) 查询解释开始,其中轻量级 Vid-LLM 使用统一采样概述将查询分解为互补的子查询,从而使隐式证据要求变得明确。然后,(b) 证据定位采用基于嵌入的检索工具根据原始查询和子查询对候选帧进行评分,然后进行熵自适应评分融合和 DPP 选择以获得相关且视觉上多样化的关键帧。最后,(c) 反射将反馈帧与概述合并,删除重复项和视觉上最不对齐的概述帧以维持帧预算。生成的混合概述指导下一轮选择的子查询细化。