论文
ET-Prune:用于文本丰富的 MLLM 中视觉词元修剪的证据感知动态预算
ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs
摘要
视觉标记修剪降低了多模态 大语言模型 的推理成本,但固定标记比率与丰富文本输入的匹配性较差。在以 OCR 为中心的任务中,决定性证据可以是少量数字、标签或字段,其相关性由问题指定;不加区别的修剪可以消除这些证据,同时保留视觉上显着但不相关的区域。我们提出了 ET-Prune,一个 无需训练 框架,它将剪枝作为证据分配。它从解码器端部分查询密钥块中导出问题条件证据,保护类似文本的空间区域,并将证据不确定性和密度转换为特定于样本的词元层。然后,三个渐进的中间层事件将序列朝着这个预算移动,为分散的或文本密集的证据保留更多的标记,并更积极地修剪集中的证据。在每个配置的一次确定性传递的观察点估计中,ET-Prune 在所有六个主干基准比较中领先或并列于修剪方法中,大约有一半的标记。在 OCRBench-v2 上,它在 Qwen3-VL-8B 和 InternVL3.5-8B 上分别领先最强的修剪基线 1.80 和 0.68 个百分点,同时保留了大约一半的视觉标记;在 MMBench v1.1 上,它达到了 0.8467 的圆形精确匹配精度,而 Vanilla 为 0.8437,平均视觉标记保留率为 54.45%。这些结果表明,在文本丰富的多模态推理中,证据感知动态预算具有良好的观察到的质量成本权衡。