论文

AI助手真的能忘记吗?可寻址内存中的可审核删除

Can an AI Assistant Really Forget? Auditable Deletion from Addressable Memory

模型训练模型编辑与遗忘

摘要

助手可以停止重复某个事实,而无需将其从记忆中删除。为了研究这种差异,我们在冻结的 Gemma 3 中安装了支持向量门,并记录哪些存储的键和值属于每个交换。删除请求将交换的行从远程读出中排除,并重新计算剩余内容的门。我们根据独立改装检查此操作,然后将其与在没有交换的对话中再次运行模型进行比较。第二次比较很重要,因为交换可能已经影响了幸存的内存行。在 4B 时,门控模型通过了对基础模型承认的八条记录中相同的六条记录的召回和可行删除检查,困惑度成本低于 2%。具有相同配置的较小和较大检查站的入场人数有所下降。编辑后的记忆与注册探针的本地改装非常一致,并且该模型披露的删除答案比简单地指示忘记时要少。然而,对每个记录单独评估的攻击仍然可以区分编辑过的内存和从未存储过该记录的内存。因此,排除交换器自己的行提供了一种编辑和审核会话内存的方法,同时与在没有交换器的情况下重建会话内存留下了可测量的差异。其他配对研究发现,当前 FP32 代理没有更新速度优势,并且在每个测试条件下保留答案匹配都低于一半。