论文

救援效应:空间语义提前退出绕过 CLIP 中的量化崩溃

The Rescue Effect: Spatio-Semantic Early Exit Bypasses Quantization Collapse in CLIP

模型推理推理加速

摘要

在资源受限的硬件上部署视觉语言模型通常需要 INT8 量化,但在 CLIP 等联合嵌入架构中,这引入了与量化 CNN 分类器不同的故障模式:Transformer 块上累积的激活噪声扰乱了多模态嵌入的方向,侵蚀了零样本检索所依赖的余弦对齐。我们将其描述为量化引发的表示崩溃 (QIRC),并在 INT8 CLIP ViT-B/32 上对其进行量化,其中逐层噪声信号比从浅层块中的 10% 以下增长到第 11 层的 52%。我们提出 LRA-EE(逐层表示感知早期退出),它通过空间语义聚合绕过噪声饱和的深层(取代具有全局 patch-token 平均值的不成熟的浅层 [CLS]),学习的多特征门(置信度,top-2 边缘,空间激活方差),以及根据每层的信息噪声比校准的层自适应置信度阈值。在 ImageNet-1K 零样本分类中,与 INT8 基线相比,LRA-EE 将 FLOP 减少了 13.4%,并将 Top-1 准确率提高了 +2.44%p (58.72% -> 61.16%)。四象限分解隔离了救援效应:9.5% 的样本在浅层出口处被正确分类,但在全深度处被噪声丢失,而只有 7.1% 的样本遭受相反的情况。