论文
OccamToken:使用 无需训练 和预算自适应词元修剪进行高效 VLM 推理
OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning
摘要
视觉语言模型 (VLM) 依赖于长视觉标记序列来进行视觉理解,这使得预填充阶段的计算和内存成本都很高。大多数现有的修剪方法遵循绝对排名范例,为视觉标记分配重要性分数并保留固定的前 K 子集。在这项工作中,我们认为这种范式从根本上来说是脆弱的:注意力集中扭曲了词元重要性排名,而图像冗余和依赖于查询的视觉证据使得固定的 词元预算 在输入中不可靠。我们提出 OccamToken,一个 无需训练 框架,用寄存器锚定的相对证据测试取代绝对词元排名。 OccamToken 不是询问哪些标记是全局重要的,而是评估视觉标记是否提供超出基于寄存器的引用的信息。我们的主要见解是,注册词元自然地吸收低信息注意力模式,使它们成为识别真正信息丰富的视觉证据的稳定参考。基于这一原理,OccamToken 通过从寄存器注意力中导出的动态阈值来执行图像自适应冗余剪枝和查询自适应相关性剪枝。在 LLaVA-NeXT、LLaVA-v1.5 和 Qwen3-VL 中,OccamToken 持续改善准确性与效率的权衡,无需额外训练。值得注意的是,在 LLaVA-NeXT 上,它将 2,880 个视觉标记减少到大约 40 个,同时保留了超过 93% 的原始精度,即使在极端的 1.4% 保留率下也能实现稳定的视觉标记压缩。