论文
用于视觉标记修剪的 AI4AI 框架
An AI4AI Framework for Visual Token Pruning
摘要
视觉词元修剪可以大大降低多模态 大语言模型 (MLLM) 的推理成本,但现有方法很大程度上依赖于固定的、手工设计的启发式方法和昂贵的专家试错法。随着修剪目标、预算和模型架构的多样化,手动导航不断扩大的设计空间变得越来越困难。本文旨在通过解决一个自然问题来构建用于视觉标记修剪的 AI4AI 框架:大语言模型 能否自动设计有效的视觉标记减少算法?尽管 LLM 拥有广泛的算法知识和强大的推理能力,但将这些常识转化为专门任务的有效解决方案仍然很重要。我们认为关键在于设计一种适当的搜索状态表示,将 LLM 的内部知识与视觉标记修剪的结构要求和约束联系起来。基于这一见解,我们提出了 AutoPrune,这是一个用于 LLM 驱动的视觉词元修剪策略设计的 无需训练 框架。 AutoPrune 的核心是引入了词元修剪领域特定语言 (TPDSL),其中包含 131 个可重用原子,用于预算控制、词元评分、选择约束和词元重组。 TPDSL 的一个关键属性是它将每个搜索状态表示为强基础策略的剩余修改。这种残差公式缩小了搜索空间,并将 LLM 的注意力引导到对性能最重要的策略组件上。在 14 个多模态基准和三个 MLLM 主干上进行的实验证明了 AutoPrune 的有效性、效率和可转移性。即使删除 94.4% 的视觉词元,AutoPrune 仍能保留超过 99% 的完整词元性能,同时将 FLOP 减少 9.9 倍,将预填充延迟减少 6.4 倍。