论文

VideoMM:高效视频多模态模型的自适应宏微观推理

VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs

模型推理推理加速

摘要

长视频理解中的视觉token爆炸会挤满上下文窗口并带来高成本,限制多模态大模型扩展。当前方法多靠辅助模型缩减token,却两难:轻量编码器易忽视关键语义,重型多模态模型缩减又抵消效率收益。我们发现更根本的低效:细粒度视觉细节对详细理解必要,对初步选择语义相关区域却大量冗余。因此提出VideoMM,从以模型为中心的缩小转向自适应感知粒度。框架解耦选择和推理,在由降采样帧得到的低成本宏观代理上语义过滤,仅必要时把选中区域投影到高保真微观token以详细理解。广泛评估显示明显优于现有方案:在LongVideoBench上相较全上下文基线加速6.13倍,准确率提高7.4%,并比当前领先方法再加速2.73倍,为长视频理解提供可扩展范式。代码见原摘要链接。

VideoMM:高效视频多模态模型的自适应宏微观推理:论文配图
图2:VideoMM框架。(a)第一阶段使用宏观视图代理进行分组选择,高效识别信息丰富区域。(b)第二阶段通过共识判断语义是否充分,仅在必要时加入微观视图视频,执行自适应宏微推理。