论文
VideoMM:高效视频多模态模型的自适应宏微观推理
VideoMM: Adaptive Macro-Micro Inference for Efficient Video MLLMs
摘要
长视频理解中的视觉token爆炸会挤满上下文窗口并带来高成本,限制多模态大模型扩展。当前方法多靠辅助模型缩减token,却两难:轻量编码器易忽视关键语义,重型多模态模型缩减又抵消效率收益。我们发现更根本的低效:细粒度视觉细节对详细理解必要,对初步选择语义相关区域却大量冗余。因此提出VideoMM,从以模型为中心的缩小转向自适应感知粒度。框架解耦选择和推理,在由降采样帧得到的低成本宏观代理上语义过滤,仅必要时把选中区域投影到高保真微观token以详细理解。广泛评估显示明显优于现有方案:在LongVideoBench上相较全上下文基线加速6.13倍,准确率提高7.4%,并比当前领先方法再加速2.73倍,为长视频理解提供可扩展范式。代码见原摘要链接。
