论文

AdaFocus:具有零缓存回溯功能的自适应相关性多样性采样,可实现高效的长视频理解

AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

上下文与知识上下文工程

摘要

长视频理解受到严格的一次性范式的严重瓶颈:现有方法要么以令人望而却步的内存和延迟成本对视频进行密集编码,要么将它们积极压缩为稀疏帧集,从而不可逆地丢弃下游推理所需的细粒度证据。因此,当前的模型很难同时平衡时间覆盖、视觉细节和计算效率。我们提出了 AdaFocus,这是一种有效的框架,它将长视频理解重新视为渐进式证据获取而不是一次性编码。 AdaFocus 依赖于两个紧密耦合的组件。首先,查询感知自适应相关性多样性采样器 (AdaRD) 生成紧凑但信息丰富的视频预览,当查询缺乏可靠的本地基础时,自适应地切换到全局聚类。其次,AdaFocus 引入了一种不确定性触发的细化机制,而不是在内存中缓存详尽的帧序列。仅当模型不自信时,它才执行有针对性的回溯,通过零缓存 I/O 设计直接从磁盘检索高分辨率证据。这将丢弃的视觉细节从不可逆转的损失转变为按需可恢复的证据,而无需支付详尽的预加载成本。对七个标准长视频基准的实验表明,AdaFocus 提供了比强基准更好的效率与准确性权衡。与传统的密集编码相比,AdaFocus 实现了更高的任务性能(例如,通过单遍推理,VideoMME 上的准确率 +2.59,Charades-STA 上的 +8.39 mIoU),同时将视觉词元消耗减少约 33 倍,并通过其零缓存磁盘检索设计消除了内存中帧预缓存的需要。这些发现表明,渐进式预览与零缓存证据细化相结合是可扩展多媒体推理的高效范例。