论文

OmniDrop:基于查询引导的全模态LLM逐层token剪枝

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

摘要

全模态大语言模型在整体性多模态理解上展现出显著潜力;然而,高分辨率音频和视频输入引发的token爆炸仍是实时应用与长篇推理的关键瓶颈。现有全模态token压缩方法通常在输入嵌入层面剪枝token,依赖音视频相似性或时间共现作为语义相关性的代理。实践中,这类假设往往不可靠。为解决这一局限,我们提出OmniDrop,一个免训练的逐层token剪枝框架,在LLM解码器层内部而非输入层逐步剪除视听token,让早期层保留充分的全模态信息融合,再在更深层积极移除token。我们进一步利用文本查询作为引导,实现模态无关且任务自适应的token剪枝。我们还引入时间多样性分数,鼓励token均衡存活以保持全局时间上下文。在多个视听基准上的实验结果表明,OmniDrop领先所有基线最多3.58分,同时将预填充延迟最多降低40%、内存占用最多降低14.7%。

OmniDrop:基于查询引导的全模态LLM逐层token剪枝:论文配图
图1:(a)音频与视频token在LLM嵌入空间的PCA分布;(b)余弦相似度分布,支撑分层token剪枝。