论文
SIEVE:视觉语言模型遗忘的选择性注意价值抑制
SIEVE: Selective attention-value Suppression for Vision-Language Models Unlearning
摘要
视觉语言模型(VLM)将视觉身份与传记信息相关联的能力产生了选择性忘记个人身份信息(PII)的需要,同时保留有关同一个人的允许的知识。这种设置具有挑战性,因为敏感信息和保留信息可以共享相同的视觉输入和中间表示。我们引入了 SIEVE,这是一个用于选择性 VLM 忘却的简单而有效的框架。 SIEVE 直接规范注意力值表示,同时还控制模型输出。 SIEVE 将忘记示例的注意力值抑制为常数零,同时通过将保留示例表示与冻结参考模型匹配来保留保留示例表示。这些目标与序列级遗忘和保留监督相结合,实现有针对性的遗忘,而不会在很大程度上影响保留的知识。大量实验表明,SIEVE 在多种模型模态设置的遗忘方面实现了最先进的性能,同时保持了具有竞争力的保留效用。消融研究进一步表明,价值抑制和负交叉熵贡献了互补的遗忘信号,而基于参考的价值匹配大大减少了效用退化。这些结果表明,当敏感知识和保留知识密切相关时,注意力价值为选择性多模态遗忘提供了有效的干预点。