论文
RACER:通过反思查询与工具检索选择长视频关键帧
RACER: Reflective Agent Coupling Query Interpretation and Tool-Based Retrieval for Frame Selection in Long Video Understanding
摘要
视频大语言模型 (Vid-LLM) 通过对选定帧进行推理,擅长执行各种视频语言任务。然而,长视频的帧选择仍然具有挑战性,因为它需要在给定复杂查询的情况下从大型候选池中检索分布在各个片段上的相关帧。本文从任务分解的角度研究了长视频帧选择的主要方法,确定了两个关键挑战:基于相似性的方法中的查询理解差距和基于判断的方法中的解释-选择差距。为了解决这些问题,我们提出了 RACER,这是一种免训练的反射式 Agentic 框架,它将长视频帧选择分解为由轻量级 Vid-LLM 驱动的查询解释和由用作检索工具的嵌入模型支持的证据定位。具体来说,Vid-LLM 仅负责将复杂查询重新表述为子查询,使隐式信息需求变得明确,从而缩小查询理解差距。同时,检索工具利用这些子查询来定位相关证据,减轻了 Vid-LLM 的直接框架选择,从而解决了解释-选择差距。最后,检索到的帧被反馈到 Vid-LLM 进行子查询细化,形成一个反射循环,迭代地改进查询解释和帧选择。跨多个基准测试的实验表明,RACER 持续改善长视频理解。值得注意的是,即使使用功能有限的组件,RACER 也能实现有效的帧选择,这表明 Agentic 集成使这些组件能够增强功能更强大的 Vid-LLM。
