论文

RoRA:MLLM 中视觉词元修剪的面向角色的区域分配

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

模型推理推理加速

摘要

多模态 大语言模型 (MLLM) 将图像编码为长视觉词元序列,使得预填充和 KV 缓存存储变得昂贵。现有的 无需训练 修剪方法根据重要性、多样性或空间覆盖范围来选择标记,但将保留的标记视为可互换的,并且不明确跟踪哪些与对象相关的区域已经被覆盖。我们提出了 RoRA,一个 无需训练 框架,它将视觉词元修剪作为面向角色的区域证据分配。给定固定预算,RoRA 将词元划分为受保护的语义核心、互补上下文和细粒度细节。它首先使用位置先验和提示校准对象先验来校准文本条件注意力,然后从高置信度锚点构建注意力锚定区域(AAR)作为覆盖对象支持的轻量级代理。主要在 AAR 之外探索背景,而 AAR 指导下的少量预算则恢复本地细节;成对相似度仅用于上下文阶段冗余过滤。在匹配的预算下,RoRA 在 LLaVA 和 Qwen-VL 系列中始终优于强大的 无需训练 基线,即使在激进的剪枝率下也保留了大部分未剪枝的准确性,例如,在 LLaVA-1.5 上,在 88.9% 剪枝时,完整性能达到 96.5%;在 Qwen3-VL 上,在 75-90% 剪枝时,比 D2Pruner 提高约 5%。在剪枝率为 66.7% 的情况下,RoRA 仅需要 0.7 毫秒进行词元选择,并将端到端推理时间减少了 24.6%,相当于 NVIDIA H800 上未剪枝推理的速度提高了 1.33 倍。