论文
视觉词元修剪何时可以改进校准?证据覆盖率在 MLLM 中的作用
When Does Visual Token Pruning Improve Calibration? The Role of Evidence Coverage in MLLMs
摘要
视觉词元剪枝被广泛用于降低多模态 大语言模型 (MLLM) 的推理成本,但通常仅通过准确性来评估。我们研究了修剪如何影响校准(定义为置信度和正确性之间的一致性),并表明选择规则比单独的 词元预算 更重要。在使用 LLaVA-1.5 的 POPE 上,基于覆盖范围的修剪从 576 个词元减少到 128 个词元,将预期校准误差从 0.041 减少到 0.016,而没有出现统计上显着的精度损失。相比之下,基于注意力的选择可以保留信心,但准确性会下降,与激进预算下的随机修剪相比,其校准程度较低。在修剪条件下,保留设定的覆盖率与准确性密切相关(Spearman $ρ=+0.89$),但与平均置信度无关($ρ=-0.03$),与过度自信产生强烈的反比关系($ρ=-0.92$);受控的固定干预措施支持这种证据覆盖说明。有两个边界限制了它:查询条件的 FastV 比其覆盖率预测的更加自信,并且在语言优先主导的 ScienceQA 上,覆盖率停止排序校准。选择器排序可以推广到 GQA 和 LLaVA-NeXT,并且 Qwen2-VL 上的覆盖范围是随机的,尽管未剪枝模型的校准增益取决于任务和模型。我们还发现了 FastV 中的一个评估陷阱:归零而不是删除修剪的标记可能会降低准确性。因此,视觉标记修剪会改变置信度质量和效率,在比较修剪方法时,应评估校准和准确性。