论文

通过免训练时空池化与网格化增强视频大语言模型的视觉token表示

Enhancing Visual Token Representations for Video Large Language Models via Training-Free Spatial-Temporal Pooling and Gridding

上下文与知识上下文工程

摘要

多模态大语言模型(MLLM)的最新进展显著推动了视频理解任务,但在高效压缩视觉token的同时保留时空交互方面仍存在挑战。LLaVA家族等现有方法采用简单朴素的池化或插值技术,忽视了视觉token复杂的动态特性。为弥合这一差距,我们提出ST-GridPool,一种专为视频LLM设计的新型免训练视觉token增强方法。我们的方法集成了金字塔时间网格化(Pyramid Temporal Gridding, PTG)——通过分层时间网格化捕获多粒度时空交互;以及基于范数的空间池化(Norm-based Spatial Pooling, NSP)——利用token范数与语义丰富度之间的相关性来保留高信息量的视觉区域。在多种基准上的大量实验表明,ST-GridPool无需昂贵的重新训练即可持续提升视频LLM的性能。我们的方法为改进视觉token表示提供了高效的即插即用方案。代码发布于https://github.com/bingjunluo/ST-GridPool。

通过免训练时空池化与网格化增强视频大语言模型的视觉token表示:论文配图
图 2:ST-GridPool 概述。该方法以令牌序列 𝑻1,⋯,𝑻N{\bm{T}}_{1},\cdots,{\bm{T}}_{N} 作为输入,并输出池化令牌 𝑻1↓,⋯,𝑻N↓{\bm{T}}_{1}^{\downarrow},\cdots,{\bm{T}}_{N}^{\downarrow},它由两个主要组件组成:金字塔时间网格和基于规范的空间池。