论文
基于 LLM 的智能体的轨迹遗忘
Trajectory Unlearning on LLM-based Agents
摘要
现有的大语言模型 (LLM) 遗忘主要侧重于删除特定知识,例如有害事实、私人数据或受版权保护的内容。然而,随着 LLM 越来越多地被部署为自主Agent,一个基本但被忽视的问题出现了:除了抑制Agent所知道的内容之外,Agent不应该通过其行动轨迹重现不良行为。在这项工作中,我们引入了轨迹级遗忘,这是一种新的问题表述,其目标是消除长期 agentic 任务中的特定动作轨迹,而不是事实知识。我们确定了区分轨迹遗忘和知识遗忘的两个基本挑战:(1)我们的遗忘目标是Agent做什么,而不是它说; (2) 轨迹是顺序相关的动作序列,不能在不丢失步骤间结构的情况下分解为孤立的提示-响应对。为了应对这些挑战,我们提出了组注入相对策略优化(GiRPO),它将遗忘轨迹注入具有惩罚奖励的策略rollout组中,并隔离归一化统计数据,产生稳定且有界的未学习信号,不会破坏正常任务轨迹的梯度更新。我们从家庭任务(ALFWorld)和在线购物(WebShop)这两个应用场景构建了轨迹遗忘基准,并设计了三个补充指标来评估遗忘质量和模型效用。 ALFWorld 和 WebShop 上的实验表明,GiRPO 可以有效地忘却目标轨迹,同时保持任务成功率,在遗忘质量和任务效用方面均优于现有的知识忘却基线。