论文
稀疏自动编码器支持 CLIP 模型的鲁棒性和可解释性 微调
Sparse Autoencoders enable Robust and Interpretable Fine-tuning of CLIP models
摘要
像 CLIP 这样的大规模预训练视觉语言模型在不同的任务中展示了卓越的零样本性能。然而,微调 这些提高下游性能的模型通常会降低针对分布变化的鲁棒性。最近的方法试图减轻这种权衡,但通常依赖于计算成本高昂的文本指导。我们提出了一种鲁棒 微调 的新方法,即 SAE-FT,它仅对模型的视觉表示进行操作。 SAE-FT 通过惩罚在预训练模型上训练的稀疏自动编码器识别的语义上有意义的特征的添加和删除来规范对这些表示的更改。此约束可防止灾难性遗忘,并使 微调 过程可解释,从而能够直接分析语义变化。 SAE-FT 具有机械透明性和计算效率,匹配或超过 ImageNet 及其相关分布偏移基准的最先进性能。代码可公开获取:https://github.com/Fabian-Mor/sae-ft。