论文

重新思考长视频中的RAG:检索什么以及如何使用?

Rethinking RAG in Long Videos: What to Retrieve and How to Use It?

上下文与知识检索增强

摘要

检索增强生成正在从文本转向以自我为中心的长视频,其中系统必须跨多种模式和时间粒度选择与查询相关的块。然而,VideoRAG 的进展受到两个差距的限制:现有的基准测试允许在没有视频的情况下回答查询,掩盖检索错误,并且先前的方法对每个查询应用单一模态粒度配置,忽略块级可变性。我们通过引入 V-RAGBench 来解决这两个问题,V-RAGBench 是 $\langle$query、证据块、answer$\rangle$ 三元组的基准,可以对检索和生成进行忠实、解耦的评估,而 CARVE 是一种跨配置运行并行检索器的简单方法,并采用块自适应重新排名来识别每个块的获胜配置。然后,每个块在检索期间选择的获胜配置下进入生成器,产生交错的证据形式,其中块级决策在两个阶段中传播。 CARVE 的性能优于最近的八个 VideoRAG 基线,提供给生成器的块交错多个配置而不是共享单个配置,这是查询级方法无法实现的行为。

重新思考长视频中的RAG:检索什么以及如何使用?:论文配图
图 1:CARVE 概述:第 1 阶段通过块并行检索构建候选池,而第 2 阶段执行块自适应重排序。最终的 top-kk 证据及其获胜配置以模态交错的形式传递给生成器。