论文

CLIP 知道但不能说的:从冻结的中间特征中恢复否定

What CLIP Knows but Cannot Say: Recovering Negation from Frozen Intermediate Features

模型推理推理策略与问题分解

摘要

对比视觉语言模型(例如 CLIP)将语义相反的短语(例如“狗”与“不是狗”)映射到几乎相同的嵌入,使它们对否定不敏感。我们将这种失败归因于一种称为“表征崩溃”的现象:通过跟踪 CLIP 文本编码器中的构图分歧和视觉对齐,我们发现中间层构建了构图语法,但随着视觉对齐的上升,最终层会崩溃该结构,从而产生语法盲的最终表示。为了在不改变预训练权重的情况下恢复丢失的否定信号,我们提出了 PeakPatch,这是一种轻量级事后校正系统,可以在编码器的合成峰值处拦截编码器。嵌入校正网络(ECN)使用交叉注意力从峰值层提取特定于否定的信号,锚定到稳定的基线,并预测偏差向量,将丢失的语法重新注入最终层嵌入空间。互补的分数校正网络 (SCN) 可以预测判别任务的有界标量分数偏移。两个模块都进行端到端联合训练,同时所有 CLIP 参数保持冻结,仅添加 520 万个参数(主干的 3.5%)并保留标准余弦相似度接口。在 NegBench 上,PeakPatch 在 COCO MCQ 上实现了 74.3%(比 CLIP 多了 35.1,比最佳编码器 微调 方法多了 17.8),在 VOC MCQ 上实现了 65.5%,同时在完全分布外否定检索上优于所有 微调 基线,尽管只训练了 3.5% 的参数。校正后的嵌入还转移到文本到图像的生成(+18.4 否定分数)并在 ViT-B/32、ViT-L/14 和 SigLIP 主干上进行推广。项目网址:https://stevencylu.github.io/PeakPatch/。