论文
MARQUIS:视频检索增强生成的三阶段管道
MARQUIS: A Three-Stage Pipeline for Video Retrieval-Augmented Generation
摘要
视频的检索增强生成要求系统从大型语料库中检索相关的视听证据,并将其合成为连贯的归因文本。当前的方法在两端都存在困难:检索方法无法处理无法通过单个嵌入捕获的复杂、多方面的查询,而生成方法缺乏跨多个视频进行合成所需的高级推理,并且在长的多视频上下文中面临内存限制。我们提出了 MARQUIS:一个三阶段管道,通过 (1) 查询扩展、融合和重新排名,(2) 校准的结构化证据提取,以及 (3) 从提取的证据生成文章(可选地由 RLM 控制)来解决这些限制。在 MAGMaR2026 共享任务上,我们将检索性能从 0.195 提高到 0.759 (nDCG@10)。对于文章生成,ITER-QA-BASE 将 CAG 基线的平均人类得分从 3.09 提高到 3.83,而 MARQUIS-RLM 实现了 3.30 的人类得分,并且是非 QA 系统中最强的引文召回率。