论文
OmniDelta:OmniLLM中token压缩的技能驱动预算分配
OmniDelta: Skill-Driven Budget Allocation for Token Compression in OmniLLMs
摘要
新兴的全模态大语言模型(OmniLLM)实现了文本、音频与视频的统一理解,但其漫长的音视频token序列带来可观的内存与推理成本。现有压缩方法主要关注固定预算下选择重要token,而对其前置的预算分配问题探索不足。我们表明,直接的查询-音/视频相似度对模态间预算分配并不可靠,且模态内均匀预算会在保留冗余内容的同时错过关键证据。为解决这些局限,我们提出OmniDelta,一个免训练、技能驱动的框架,将意图感知的模态间分配与内容感知的模态内分配相结合。OmniDelta首先构建音频与视频技能池,根据查询需求移动固定的保留token预算,然后利用局部复杂度与时间冗余,在音频片段与视频帧上重新分配模态预算。所得局部预算可与现有剪枝策略结合,在保持总保留token比例的同时改变预算花费的位置。在两个Qwen2.5-Omni模型上的四个音视频基准实验表明,OmniDelta在各剪枝比例上建立了新的精度-效率Pareto前沿。在Qwen2.5-Omni-7B上保留25% token时,OmniDelta将GPU内存降低22.0%,并相对全token推理取得1.64倍端到端加速。
