论文
并非所有视觉标记都同样可以安全删除:结果敏感的视觉标记压缩
Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression
摘要
视觉语言模型 (VLM) 的视觉词元压缩在很大程度上依赖于注意力、冗余和不确定性等标准,以在固定计算预算下最大化平均准确度,隐含地假设所有错误都具有相同的成本。然而,对下游任务的错误预测的后果很少是对称的:误读发票金额可能比错误分类背景颜色的代价要高得多。受此启发,我们引入了结果敏感的视觉词元压缩,它根据潜在的错误成本在请求之间分配视觉计算。我们的方法遵循校准然后分配程序,离线估计结果特定的误差预算曲线,并使用从问题或任务信息中获得的结果信号在线应用校准的 词元预算。在受控的任务内基准测试中,高后果问题和低后果问题是从相同的文档图像中提取的,因此仅凭内容无法揭示哪些问题犯错的代价高昂。在此设置中,我们的方法在相同的总 词元预算 下将高风险错误从 0.300 减少到 0.133,而内容驱动分配器的性能并不比统一分配更好。通过测量不同成本比率下 词元预算 的错误率如何变化,我们得出了一个分配前沿:当错误成本相同时,统一分配是最佳的,并且随着成本差距的扩大,针对高后果问题的词元转移变得越来越有利。这种分配原则可以很好地推广到三个密集视觉语言基准、两种预算实现机制(词元删除和分辨率重新分配)、两种 VLM 架构和多种词元选择策略。在现实的混合工作负载上,结果敏感的分配可将成本加权错误减少 38%,同时比全分辨率推理降低约 21% 的延迟。