论文
PersistBench:LLM 何时应遗忘长期记忆?
PersistBench: When Should Long-Term Memories Be Forgotten by LLMs?
摘要
对话助手日益将长期记忆与大语言模型(LLM)相结合。这种记忆的持久性(例如用户是素食者)可以增强未来对话的个性化。然而,同样的持久性也可能引入很大程度上被忽视的安全风险。因此,我们提出 PersistBench 来衡量这些安全风险的程度。我们识别出两种长期记忆特有的风险:跨域泄露,即 LLM 不恰当地注入来自长期记忆的上下文;以及记忆诱发谄媚,即存储的长期记忆暗中强化用户偏见。我们在基准上评估18个前沿与开源 LLM。结果显示这些 LLM 的失败率高得惊人——跨域样本的中位失败率为53%,谄媚样本为97%。为此,我们的基准鼓励在前沿对话系统中开发更稳健、更安全的长期记忆使用方式。
