论文
重新思考长视频中的RAG:检索什么以及如何使用?
Rethinking RAG in Long Videos: What to Retrieve and How to Use It?
摘要
检索增强生成正在从文本转向以自我为中心的长视频,其中系统必须跨多种模式和时间粒度选择与查询相关的块。然而,VideoRAG 的进展受到两个差距的限制:现有的基准测试允许在没有视频的情况下回答查询,掩盖检索错误,并且先前的方法对每个查询应用单一模态粒度配置,忽略块级可变性。我们通过引入 V-RAGBench 来解决这两个问题,V-RAGBench 是 $\langle$query、证据块、answer$\rangle$ 三元组的基准,可以对检索和生成进行忠实、解耦的评估,而 CARVE 是一种跨配置运行并行检索器的简单方法,并采用块自适应重新排名来识别每个块的获胜配置。然后,每个块在检索期间选择的获胜配置下进入生成器,产生交错的证据形式,其中块级决策在两个阶段中传播。 CARVE 的性能优于最近的八个 VideoRAG 基线,提供给生成器的块交错多个配置而不是共享单个配置,这是查询级方法无法实现的行为。
