论文

超越准确性:审计 OCR 关键 MLLM 推理的视觉标记修剪中的空间来源

Beyond Accuracy: Auditing Spatial Provenance in Visual Token Pruning for OCR-Critical MLLM Inference

模型评测评测方法与指标

摘要

视觉词元修剪通常是通过固定保留预算下的答案质量来判断的。对于文本丰富的多模式 大语言模型 (MLLM),该协议可能会错过一个明显的失败:即使没有保留的词元在本地可追溯到支持它的小 OCR 区域,答案仍然正确。我们将这个盲点转变为证据风险审计,将答案行为与词元几何来源、干预措施和实现成本结合起来;透明的 无需训练 选择器隔离受控工作点。在锁定图像不相交确认中,保留 30% 的 Qwen Target 观察到的准确度为 0.786,而 Full 则为 0.783(配对图像簇差异 +0.003,95% CI [-0.014,+0.020]),但相同预算的 Target、Random 和 Grid 保留了截然不同的正支持覆盖率:0.620、0.270 和 0.318。在 Qwen3-VL-8B、LLaVA-1.5-7B 和 InternVL3.5-8B 中,匹配的对照、干预措施、检测器测试和外部方法揭示了模型特定的质量-风险-可追溯性前沿,而仅靠准确性并不能揭示这些前沿。物化前缀可实现高达 4.32 倍的批量预填充加速,并将增量峰值内存降低 76.4%;完全验证 TextVQA 和 DocVQA 进一步表明,有利的目标验证点并不意味着任务通用压缩。因此,视觉词元修剪应该报告幸存的空间来源和实现的成本以及质量和压缩。