论文

视觉语言模型的无物体幻觉强化遗忘

Object Hallucination-Free Reinforcement Unlearning for Vision-Language Models

模型训练模型编辑与遗忘

摘要

视觉语言模型 (VLM) 引起了人们对隐私、版权和偏见的日益关注,促使机器通过忘却学习来删除敏感知识。然而,现有的方法主要是对语言解码器进行微调,导致肤浅的遗忘,无法擦除底层的视觉表征,并且常常会引入物体幻觉。我们提出了 HFRU,这是一种强化取消学习框架,可在视觉编码器上运行以进行深度语义删除。我们的两阶段方法将对齐中断与基于 GRPO 的优化结合起来,使用复合奖励,包括鼓励语义上有效替换并减轻幻觉的抽象奖励。物体识别和人脸识别任务的实验表明,HFRU 实现了超过 98% 的遗忘和保留性能,同时引入的物体幻觉可以忽略不计,显着优于先前的方法。我们的代码和实现细节可在 https://github.com/XMUDeepLIT/HFRU 获取。