论文
在推理之前进行校准:针对 VLM 中的语义漂移进行稳健的视觉标记减少
Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs
摘要
由于视觉标记序列较长,大型视觉语言模型 (VLM) 的推理开销过高。然而,现有的视觉标记缩减方法主要通过修剪或压缩冗余标记来提高效率,而不检查结果表示在语义上是否与原始表示保持一致。将原始 N 标记视觉序列映射到 K 标记可能会丢弃、淡化或错误分配关键视觉线索,从而引发严重的语义漂移,从而偏离 VLM 的理解。在本文中,我们首先将“Calibrate Before Reason”的原则引入视觉标记缩减,并提出 CaRe,这是一个 无需训练 鲁棒框架,可在推理之前校准紧凑的视觉表示,以保持 VLM 中的语义保真度。 CaRe由两个相互补充的模块组成:1)扰动鲁棒校准锚定,识别多方向扰动下具有稳定模型侧影响的校准锚点; 2)置信门控词元校准,从未选择的词元中提取可靠的校准信号并将其注入锚点。对不同 VLM 架构和基准的广泛评估证实,CaRe 的性能优于最先进的词元减少基准。在修剪 94.4% 的视觉标记的同时,我们的方法保留了 96.4% 的原始全标记性能,相对于未修剪的普通模型,端到端推理速度提高了 2.30 倍。