论文
先分配、后排序:OmniLLM的解耦Token压缩
Allocation Before Ranking: Decoupled Token Compression for OmniLLMs
摘要
在 OmniLLMs 中,令牌压缩通常被视为一个单一的突出度排名问题:为每个多模态令牌评分,保留前 K 个。我们认为这种抽象是不正确的。相同的注意力分数同时决定两个事情:每个模态保留的容量有多大,以及模态内保留哪些令牌。因此,共享的前 K 规则继承了对音频偏好的分配优先级,保留的容量用于音频令牌,而视频令牌在竞争之前没有机会。我们提出 Macer,这是一种无需训练的压缩器,首先分配明确的音频和视频预算,然后在每个模态的特定浅层进行分配化后的排名。Macer 在保留准确度的同时显著降低了令牌成本,特别是在基于音频的基准上,保留 25% 的令牌,Macer 保留了 Qwen2.5-Omni-7B 的 98.7% 的全令牌性能,而在 Qwen2.5-Omni-3B 上,保留 25% 的令牌,Macer 保留了 97.3% 的全令牌性能。在 Qwen2.5-Omni-7B 上,这个 25% 的设置在 45% 的保留率下达到 OmniZip 等级的性能,同时使用较低的 FLOPs。在 OmniVinci-9B 上,相同的分配-排名原则比共享的前 K 排名方法提高了 12.9 个百分点。
