论文

一个排名,任何预算:用于长视频理解的俄罗斯套娃证据到上下文框架选择

One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding

上下文与知识上下文工程

摘要

由于严重的帧冗余和有限的上下文窗口,帧选择对于将大型多模态模型 (LMM) 应用于长视频至关重要。由于适当的帧预算随下游 LMM、推理需求和延迟约束而变化,因此实际的选择器应该服务于多个预算。然而,现有方法通常针对每个预定义预算优化孤立的帧子集:当预算改变时,先前选择的证据可能被替换而不是逐步增强。固定权重排名允许跨预算重复使用前缀,但在每个位置应用相同的权重,忽略了早期和后期排名的不同作用。我们将长视频帧选择制定为俄罗斯套娃排序问题:构建一个单一优先级序列,其小前缀集中查询条件证据,而逐渐变大的前缀保留该证据并添加更广泛的时间上下文。有效构建这样的排名本身就具有挑战性,因为密集采样长视频和评估帧查询相关性会产生大量开销。因此,我们引入了 Matryoshka Evidence-to-Context (MEC) 帧选择,这是一个 无需训练 框架,它构建可重​​用的稀疏视频索引,通过稀疏探测和局部缩放发现候选者,并贪婪地构建位置自适应排名 - 早期位置强调证据;后来的立场逐渐倾向于时间覆盖,同时保留视觉多样性。因此,可以将单个排名截断为任何目标预算,而无需重新运行选择器。在四个基准测试和六个帧预算中,MEC 将均匀采样的平均准确度提高了 3.77 个点,与强大的最先进的选择器相匹配,并将端到端选择延迟降低了 47.37-51.19%。