论文
遗忘在权重中,通过工具恢复:LLM 代理的代理工具遗忘
Forgotten in Weights, Recovered by Tools: Agentic Tool Unlearning for LLM Agents
摘要
大语言模型 (LLM) 越来越多地被部署为工具增强代理,其中响应可以取决于工具调用和外部观察,而不仅仅是模型参数。这会导致 LLM 遗忘的评估不匹配:以前的遗忘方法可能会抑制直接参数回忆,但代理仍然可以通过网络搜索、检索或数据库查找等工具恢复相同的遗忘目标。我们将这种失败模式识别为工具介导的恢复和研究代理工具忘却,其目的是减少参数回忆和工具介导的恢复,同时保留保留知识的正常工具使用。为了应对这一挑战,我们提出了代理工具取消学习(ATU),这是一个两阶段框架。第一阶段应用参数化知识遗忘来抑制直接回忆,而第二阶段在模拟工具增强环境中执行轨迹级强化学习,以惩罚目标搜索工具行为和最终答案泄漏。在不同 LLM 架构上的 RWKU 和 MUSE 上的实验表明,ATU 在目标遗忘和保留效用之间实现了更好的平衡,使得遗忘在工具增强代理部署下更加稳健。