论文

面向全模态大模型的延迟音频剪枝:利用局部视听动态

Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs

模型推理推理加速

摘要

全模态大语言模型联合处理音频、视频与文本,但长多模态序列带来高昂的预填充与KV缓存成本。现有全模态压缩方法主要聚焦LLM之前的token削减,对跨越LLM边界的模态特定压缩探索不足。我们提出A-PACK,一个两阶段框架,将音频剪枝推迟到以查询为条件的多模态交互出现之后。我们的分析表明,音频每个token携带的任务相关信息密度与表征多样性高于视频。我们进一步发现,局部视听动态为视觉token选择提供了比逐token匹配更有效的线索。因此我们在LLM之前保留音频、用局部动态压缩视频,再在LLM内部渐进剪枝低相关音频与视觉token及其KV缓存条目。在Qwen2.5-Omni-7B/3B的四个基准上,A-PACK在所评估的已有方法中取得最强平均性能,同时将预填充FLOPs最多降低78%、解码吞吐最多提升2.21倍。

面向全模态大模型的延迟音频剪枝:利用局部视听动态:论文配图
图3:我们方法的概览。阶段1(LLM前)保留音频token,仅压缩视频。它为局部音视频CKA更强的帧分配更多视觉token,然后通过基于锚点的token选择消除视频内冗余。阶段2(LLM内)在多模态交互之后逐步剪除与查询无关的音频与视觉token。其对应的KV缓存条目也被一并移除,从而实现延迟的音频剪枝并降低解码成本。