论文
一尘不染的心灵的永恒阳光:系统性地删除大语言模型的记忆
Eternal Sunshine of the Spotless Mind: Systematically Erasing LLM's Memories
摘要
我们考虑持久性大语言模型,随着时间的推移,他们会积累与用户互动的记忆。此类 LLM 使用外部存储来维护记忆,它们可以查询外部存储以克服固定上下文窗口的限制。此类系统具有许多实际应用,因为它们在响应用户查询时可以利用所有过去的交互。在本文中,我们询问大语言模型是否可以忘记根据用户的请求与他们共享的信息。我们发现,当前的大语言模型无法删除此类信息——即使他们声称已经忘记了这些信息,甚至在有限的背景下进行操作。为此,我们考虑一个新的研究方向:LLM记忆的删除。我们表明,天真地删除与用户的删除请求相匹配的消息是不够的,因为对话自然会引入导致信息持久存在的消息依赖性。为了正确处理删除请求,我们提出了 DeLLM 框架。它为每个 LLM 查询动态构建相关上下文,并维护消息的来源图,以确定在删除过程中必须删除哪些消息。我们的实验表明,DeLLM 在保持实用性的同时实现了高删除率。