论文

ASRU:激活转向与强化遗忘相结合,实现多模式 大语言模型

ASRU: Activation Steering Meets Reinforcement Unlearning for Multimodal Large Language Models

模型训练模型编辑与遗忘

摘要

多模态 大语言模型 (MLLM) 可能会在预训练期间记住敏感的跨模态信息,这使得机器去学习 (MU) 至关重要。现有方法通常根据输出偏差来评估遗忘有效性,而忽略遗忘后的生成质量。这很容易导致幻觉或僵化反应,从而影响未学习模型的可用性和安全性。为了解决这个问题,我们提出了 ASRU,一种可控的多模态遗忘框架,它将生成质量作为核心评估目标。 ASRU首先通过激活重定向诱导初始拒绝行为,然后使用定制的奖励函数优化细粒度的拒绝边界,从而在目标知识遗忘和模型效用之间实现更好的权衡。 Qwen3-VL 上的实验表明,ASRU 仅使用少量保留的监督数据,显着提高了平均遗忘效率(+24.6%)和平均生成质量(5.8X),同时有效保留了模型效用。