论文

AdaptToken:用于 MLLM 长视频理解的基于熵的自适应词元选择

AdaptToken: Entropy-based Adaptive Token Selection for MLLM Long Video Understanding

上下文与知识上下文工程

摘要

由于高内存成本和上下文长度限制,长视频理解对于多模态 大语言模型 (MLLM) 来说仍然具有挑战性。先前的方法通过评分和选择短剪辑中的帧/标记来缓解这一问题,但它们缺乏原则机制来(i)比较远处视频剪辑的相关性以及(ii)一旦收集到足够的证据就停止处理。我们提出了 AdaptToken,这是一个 无需训练 框架,它将 MLLM 的自我不确定性转化为长视频词元选择的全局控制信号。 AdaptToken 将视频分成组,提取跨模式注意力来对每个组内的标记进行排名,并使用模型的响应熵来估计每个组的提示相关性。该熵信号支持跨组的全局 词元预算 分配,并进一步支持提前停止 (AdaptToken-Lite),当模型变得足够确定时跳过剩余组。在四个长视频基准测试(VideoMME、LongVideoBench、LVBench 和 MLVU)和多个基础 MLLM (7B-72B) 中,AdaptToken 持续提高准确性(例如,比 Qwen2.5-VL 7B 平均提高 6.7),并继续受益于超长输入(高达 10K 帧),而 AdaptToken-Lite 将推理时间减少了大约一半,性能相当。项目页面:https://haozheqi.github.io/adapt-token