论文

并非所有补丁都同样容易被遗忘:视觉语言模型中的空间局部域遗忘

Not All Patches Are Equally Forgettable: Spatially Localized Domain Unlearning in Vision-Language Models

模型训练模型编辑与遗忘

摘要

即使没有额外的训练,预训练的视觉语言模型(VLM)也表现出强大的跨域识别性能。然而,这种鲁棒性也可能保留不良的特定领域行为,因为领域相关信息和语义信息通常仍然纠缠在学习的表示空间中,使得选择性领域取消学习具有挑战性。现有的方法通常通过潜在空间解缠和提示或特征级干预来解决这个问题,而不直接归因和削弱个体补丁词元的贡献。然而,在这里我们建议,与其均匀地抑制完整表示,不如利用视觉变换器的空间结构来定位和抑制对遗忘域预测贡献不成比例的补丁区域可能更有效。强烈影响遗忘域预测的补丁对于语义识别可能并不同样重要,这表明应该根据不同视觉区域的域贡献来引导遗忘。具体来说,我们提出了一个两阶段的补丁选择框架,首先估计补丁级域敏感性,然后选择性地减弱对遗忘域预测的贡献强于其语义效用的补丁。我们在 Office-Home、Mini DomainNet 和 DomainNet 上评估我们的框架。实验结果表明,与之前的方法相比,改进了遗忘-保留权衡,同时将保留域识别提高了高达 3.8%。在视觉重叠和看不见的域设置下进行的额外评估进一步证明了分布变化下鲁棒性的提高。