论文

用于高效长视频理解的循证动态视觉选择器

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

模型推理推理加速

摘要

基于 MLLM 的长格式视频理解的最新进展通过选择与查询相关的帧减少了推理时间计算成本并限制了上下文长度。然而,现有方法主要依赖于外部代理评分器和严格的启发式规则,不可避免地会与目标 MLLM 的内在证据不一致,并且无法适应不均匀的时空信息密度。在本文中,我们提出了一种名为 EviSelect 的细粒度动态视觉选择框架,该框架基于目标 MLLM 内部注意力证据。我们的方法通过稀疏预填充作为结构化先验来有效地探测视觉证据,以指导分布感知动态采样。具体来说,我们使用高度压缩的视觉输入和稀疏注意力,有效地近似目标 MLLM 的注意力图,与完整的对应部分很好地对齐。以源自此先验的三个互补注意组件为条件,我们设计了一个轻量级选择器,它不仅可以精确定位与查询相关的时间戳,还可以自适应调整局部采样率和空间分辨率。为了实现证据条件时空采样,我们将选择器制定为随机策略,并在联合精度-效率奖励下通过 GRPO 对其进行优化。通过通过组相对比较在较低视觉成本下奖励正确的预测,我们的方法鼓励策略根据每个视频的信息密度动态分配计算。在三个长视频理解基准测试中,EviSelect 与现有方法相比实现了卓越的性能,同时将选定的视觉标记减少了约 50%,并实现了 3.9 倍的端到端加速。