论文

AnchorPrune:用于视觉标记修剪的相关性锚定上下文扩展

AnchorPrune: Relevance-Anchored Contextual Expansion for Visual Token Pruning

上下文与知识上下文工程

摘要

大型视觉语言模型会产生大量推理成本,因为高分辨率输入引入了数千个视觉标记,其中许多对于给定查询来说是多余的。现有的修剪方法通常将查询相关性和标记多样性结合起来,但这些目标在激进的压缩下可能会发生冲突:相关性驱动的选择可能会将预算过度集中在相关的本地证据上,而多样性驱动的选择可能会抑制不可或缺的标记或保留不同但无信息的区域。我们引入了 AnchorPrune,一个 无需训练 框架,它首先构建一个受保护的相关性锚点,然后用互补的视觉上下文对其进行扩展。 AnchorPrune 根据相关性排名标记的新颖性配置文件自适应地确定锚点大小,保留一组紧凑的查询关键证据,并通过重要性加权的新颖性分配剩余预算,以恢复相对于锚点的信息丰富的非冗余上下文。这种有序的设计可以防止上下文扩展取代不可或缺的查询线索,同时提高整体视觉覆盖范围。 AnchorPrune 是轻量级的、架构感知的,并且不需要重新训练或模型修改。在图像和视频视觉语言模型和基准测试中,它持续改进了 无需训练 基线的准确性与效率权衡,特别是在严重压缩的情况下。在 LLaVA-NeXT-7B 上,AnchorPrune 仅使用 2,880 个视觉标记中的 160 个就保留了 97.6% 的完整标记性能。这些结果将相关性锚定的上下文扩展确立为高效多模态推理的有效原则。代码可在 https://github.com/MULTI-cau/AnchorPrune 获取。