论文
何时何地查看:自适应视觉证据调度以实现高效的长视频理解
When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding
摘要
有效的长视频理解需要视觉语言模型(VLM)对被选为稀疏视觉证据的少量帧进行推理。现有的基于相关性的方法依赖于具有固定帧预算和候选池的静态一次性选择,而基于代理的调度程序通过昂贵的多轮推理和交互式搜索来实现自适应性。我们提出了 EcoFrame,一个用于低开销查询自适应视觉证据调度的 无需训练 框架。 EcoFrame 利用 VLM 的推理反馈来确定何时增加框架预算以及在何处搜索其他候选证据。具体来说,熵门控预算调度利用输出不确定性在当前证据充足时提前停止,否则逐步扩大框架预算。同时,注意力引导的候选提案将帧级注意力转换为时间先验,从而能够在信息区域进行密集的局部搜索,同时在注意力分散时保持全局覆盖。 Video-MME、LongVideoBench 和 MLVU 上的实验表明,EcoFrame 在多个 VLM 主干上实现了更好的准确性和效率权衡。在 Qwen2.5-VL 上,EcoFrame 的平均准确度达到 64.4,超过 BOLT 的 63.5,同时比 AKS 和 BOLT 提供 1.85倍的加速。与基于代理的 A.I.R. 相比,EcoFrame 保持了相当的精度,推理加速高达 13.5倍。代码可在 https://github.com/AK-DREAM/EcoFrame 获取。