论文
安全遗忘:基于 大语言模型 (LLM) 的代理中隐私驱动的忘却框架
Secure Forgetting: A Framework for Privacy-Driven Unlearning in Large Language Model (LLM)-Based Agents
摘要
由于LLM强大的推理能力,基于大语言模型(LLM)的智能体最近受到了相当大的关注。现有的研究主要集中在提高这些智能体在不同场景中的任务表现。然而,随着基于 LLM 的代理越来越多地集成到现实世界的应用程序中,人们开始担心它们积累的敏感或过时的知识。解决这些问题需要开发一种机制,允许代理选择性地忘记以前学到的知识,从而产生了一个新术语“基于 LLM 的代理忘却”。本文启动了基于 LLM 的智能体的忘却研究。具体来说,我们提出了一个新颖且全面的框架,将遗忘场景分为三种情况:状态遗忘(忘记特定状态或项目)、轨迹遗忘(忘记动作序列)和环境遗忘(忘记整个环境或任务类别)。在此框架内,我们引入了一种基于自然语言的遗忘方法,该方法训练转换模型,将高级遗忘请求转换为可操作的遗忘提示,引导代理完成受控的遗忘过程。此外,为了评估所提出的框架的鲁棒性,我们引入了一个不学习的推理对手,它能够制作提示、查询代理并观察他们的行为,以试图推断被遗忘的知识。实验结果表明,我们的方法有效地使代理能够忘记目标知识,同时保留非目标任务的性能,并防止对手推断出遗忘的知识。