论文
LAS-CLIP:冻结骨干的轻量掩码注意力适配器
LAS-CLIP: A Lightweight Adapter Steering Approach for CLIP's Visual Encoder
摘要
CLIP视觉编码器只产生全局图像表示,限制区域级任务应用。已有适应方式依赖视觉提示、输入遮罩或编码器微调,都会影响预训练表征。我们提出LAS-CLIP,即轻量适配器转向方法,保持每个CLIP参数冻结。紧凑MaskAdapter根据输入掩码生成逐头、逐层注意力偏置,并注入冻结自注意力层,把注意力引向目标区域。由于骨干完全不变,没有掩码时可无缝回到原生CLIP,保留基础零样本能力。在两块T4 GPU上,以约116K—145K可训练参数和100K样本训练,LAS-CLIP在ImageNet-S零样本分类及RefCOCO指代表达理解上与Alpha-CLIP持平或更优,后者则在数百万样本上微调整个编码器。定性分析还显示,在错误掩码及下游生成中,LAS-CLIP保持更强表征忠实性。项目页见 https://github.com/AnhKhoa585/lasclip