论文

当屏蔽有助于或损害压缩 CLIP 的鲁棒性时:部署前诊断

When Masking Helps or Hurts Robustness in Compressed CLIP: A Pre-Deployment Diagnostic

模型评测鲁棒性、公平性与可信度评测

摘要

本文证明,基于掩码的词元修剪是否有助于或损害最差组的鲁棒性,可以在部署之前预测,无需标签或微调。对 8 个虚假相关基准的语义屏蔽的系统研究表明,它对最差组准确度的影响非常不稳定:它在某些数据集上相对提高了高达 82.5% 的准确度,而在其他数据集上则使准确度降低了高达 100%。我们将这种不稳定性归因于虚假反转:当虚假属性是背景可分离时,背景块比真实对象获得更高的 CLIP 文本相似性,从而反转了每个文本和注意力引导修剪方法所依赖的假设。我们引入了虚假反演度量 (SIM),这是一种无标签的预部署诊断,其符号可以在所有 8 个数据集上以统计显着性(二项式 $p=0.035$)预测这种效应,并且在 6 个 CLIP 架构中保持可靠,具有干净的前景/背景分割。朴素掩蔽本身就是一个主要风险来源:它会导致我们评估的任何方法中最大的平均精度损失,并且它自己的每图像分割步骤是一个重要的运行时瓶颈。为了解决这个问题,我们设计了一个批量、无同步的 GPU 分段例程,将开销从 3.5$\times$ 削减到 1.75$\times$ 基线。通过 SIM 符号进行门控部署可以恢复屏蔽的优势,同时避免其最严重的故障,在 8 个数据集中的 7 个上达到或超过强修剪基线。