论文

超越帧选择:用于长视频理解的生成潜在证据聚合

Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding

上下文与知识上下文工程

摘要

长视频理解通常将视频压缩成一小组帧或视觉标记以生成答案。现有的紧凑管道侧重于保留相关视觉内容作为明确的证据。然而,提供证据并不能确保整合不同时刻的互补线索来回答问题。我们的关键思想是在生成之前将选定的帧组织成与查询相关的跨框架证据。我们将这个后选择阶段制定为潜在证据接口,并用 GenEvA ($\textbf{Gen}erative$ $Latent$ $\textbf{Ev}idence$ $\textbf{A}ggregation$) 实例化它,这是一个分布引导的潜在证据聚合框架。具体来说,GenEvA 使用查询条件证据分布将聚合集中在相关帧上,从其特定于帧的信息形成紧凑的跨帧潜在证据。由于并不总是需要跨框架集成,因此相同的分布决定是否插入此潜在补集。在四个基准测试和两个视频 MLLM 主干中,GenEvA 持续改进了匹配帧基线。在 8 帧时,它将 LVBench 上的四基准 LLaVA-Video 平均值提高了 $+5.2$ 点,将 Qwen2.5-VL 准确度提高了 $+1​​0.1$ 点。这些收益仅需要 $0.11\%$--$0.40\%$ 平均视频词元开销;分析进一步显示了任务感知分配和自适应证据调用的好处。