论文

粗略索引,精细证据:解耦长视频 RAG 中的时间粒度

Coarse Indexing, Fine Evidence: Decoupling Temporal Granularity in Long-Video RAG

上下文与知识检索增强

摘要

基于图的检索增强生成(RAG)为长视频理解提供了可扩展的范例,但现有系统在构建检索索引时通常从视频分割继承固定的时间粒度。我们认为这种设计不必要地将索引粒度与证据粒度结合起来:粗略的表示通常足以定位相关的时间区域,而细粒度的证据对于下游推理仍然很重要。我们提出\textbf{密度感知图构建(DAGC)},这是一种 无需训练 方法,它将独立于查询的粗略检索索引与原始细粒度证据空间解耦。 DAGC 通过合并视觉上冗余的相邻块来构建紧凑的、密度自适应的图索引,同时保留到原始时间单元的映射。随后,检索到的粗区域将扩展回原始块粒度,以进行细粒度证据细化和答案生成。在 MLVU、VideoMME 和 LongVideoBench 上的实验表明,DAGC 仅保留了约 40--50\% 的原始图节点,并实现了 $1.3$-$1.7\times$ 端到端挂钟加速,同时保留了约 99\% 的原始 QA 性能。增益在不同的 LVLM 主干和视频 RAG 管道之间传输,表明长视频 RAG 不需要为索引和证据推理保持相同的时间粒度。