论文
面向全模态大模型的延迟音频剪枝:利用局部视听动态
Deferred Audio Pruning with Local Audio-Visual Dynamics for Omni-LLMs
摘要
全模态大语言模型联合处理音频、视频与文本,但长多模态序列带来高昂的预填充与KV缓存成本。现有全模态压缩方法主要聚焦LLM之前的token削减,对跨越LLM边界的模态特定压缩探索不足。我们提出A-PACK,一个两阶段框架,将音频剪枝推迟到以查询为条件的多模态交互出现之后。我们的分析表明,音频每个token携带的任务相关信息密度与表征多样性高于视频。我们进一步发现,局部视听动态为视觉token选择提供了比逐token匹配更有效的线索。因此我们在LLM之前保留音频、用局部动态压缩视频,再在LLM内部渐进剪枝低相关音频与视觉token及其KV缓存条目。在Qwen2.5-Omni-7B/3B的四个基准上,A-PACK在所评估的已有方法中取得最强平均性能,同时将预填充FLOPs最多降低78%、解码吞吐最多提升2.21倍。
