论文

CAPTURE:在个性化 LLM 代理中消除记忆中毒带来的偏好漂移

CAPTURE: Disentangling Preference Drift from Memory Poisoning in Personalized LLM Agents

上下文与知识记忆Agent记忆

摘要

个性化语言代理使用持久内存来随着时间的推移适应用户,但相同的机制会产生攻击面。当新信息与存储的偏好发生冲突时,智能体必须区分真正的偏好漂移和临时上下文变化、模糊性或对抗性记忆中毒。我们将这个问题表述为针对潜在用户状态的连续时间部分可观察的决策过程,并说明了为什么仅基于新近度和出处的规则是不够的。 CAPTURE 通过神经微分方程信念跟踪器、多时间尺度记忆分类账、不确定性触发的澄清以及引用记忆的反事实审核来解决这种模糊性。在来自 96 位用户的 480 个坚持的剧集中,CAPTURE 取得了 71.5% 的胜率,而相同监督基线的胜率是 69.3%,最强启发式基线的胜率是 66.1%。它将固定策略投毒成功率限制为 11.5%,同时接受 83.5% 的真实偏好更新。在能够访问已发布权重的自适应攻击者的控制下,攻击成功率上升至 24.7%,暴露了真正的自适应与安全权衡。我们在独立构建的基准上进一步评估冻结系统的零样本,并重放两到三周内收集的 40 个用户的纵向交互历史。这些结果表明,明确地对偏好真实性进行建模可以提高记忆增强 LLM 代理的个性化和鲁棒性。