论文
抑制不是遗忘:VLM 视觉概念遗忘中的剩余可恢复性
Suppression Is Not Forgetting: Residual Recoverability in Visual Concept Unlearning for VLMs
摘要
由于隐私、版权、许可、安全或政策变化,视觉语言模型 (VLM) 在部署后可能需要忘记视觉概念。传统的机器取消学习会修改模型参数,这对于仅 API 模型来说可能成本高昂或无法访问。基于提示的抑制提供了 无需训练 替代方案,但它是否会使概念变得难以理解或仅仅改变模型的答案?我们在现成的 VLM 中研究了这个问题。我们基于视觉的多探针评估首先验证模型是否能够识别图像中的每个概念,然后通过多项选择、简答题和间接查询来测试其可恢复性。在物体、场景和身份方面,即时抑制减少了对某些概念的简答回忆,同时使多项选择和间接表现基本保持不变。明确列出要抑制的概念通常会增加简短答案的回忆,这表明列表本身就暗示了答案。除了提示之外,解码约束、表示编辑和参数更新可以抑制特定响应,同时通过其他查询仍然可以检测到相同的概念。模型可能会停止命名视觉概念,但在以不同方式查询时仍然可以识别或使用它。