论文

高效全模态的阶段自适应词元选择 LLM

Stage-adaptive Token Selection for Efficient Omni-modal LLMs

模型推理推理加速

摘要

全模态 大语言模型 (om-LLM) 的统一视听理解能力是以处理整个 LLM 中数以万计的视觉和音频标记的高成本为代价的。为了降低成本,正在积极开发用于 om-LLM 词元选择的 无需训练 方法,操作前 LLM 或内 LLM。认识到非文本词元冗余在不同阶段和 LLM 层之间有所不同,我们在本文中提出了一种新颖的阶段自适应词元选择(SEATS)方法,该方法可在 LLM 之前和 LLM 内部阶段中运行。给定通过词元保留率 (TRR) 衡量的总体 词元预算,SEATS 以依赖于输入的方式执行自上而下的 词元预算 分配。具体来说,较大的 TRR 用于 LLM 之前的词元选择,而在 LLM 内,所有词元都保留在浅层中,在中间层中应用逐渐减少的 TRR,并且在后期层中完全删除非文本词元。对三个代表性 om-LLM 和六个基准的大量实验验证了所提出方法的可行性。通过仅保留 10% 的视觉和音频词元,SEATS 在 Qwen2.5-Omni 上保留了 94.9% 的全词元性能,同时实现了 9.3 倍的 FLOP 减少和 4.9 倍的预填充加速。