论文

当个性化使风险正当化:揭示个性化对话智能体的安全漏洞

When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents

模型评测上下文与知识记忆安全与风险评测Agent记忆

摘要

长期记忆使大语言模型 (LLM) 代理能够支持个性化和持续的交互。然而,大多数关于个性化代理的工作都优先考虑实用性和用户体验,将内存视为中立的组成部分,并在很大程度上忽视了其安全影响。在本文中,我们揭示了意图合法化,这是个性化代理中先前未充分研究的安全故障,其中良性的个人记忆会偏差意图推断,并导致模型将固有有害的查询合法化。为了研究这一现象,我们引入了 PS-Bench,这是一个旨在识别和量化个性化交互中意图合法性的基准。在多个内存增强代理框架和基础大语言模型中,相对于无状态基线,个性化将攻击成功率提高了 15.8%-243.7%。我们进一步从内部表示空间为意图合法化提供了机械证据,并提出了一种轻量级的检测反射方法,可以有效减少安全退化。总的来说,我们的工作首次系统地探索和评估了意图合法性作为一种安全失败模式,这种模式自然产生于良性的、现实世界的个性化,强调了在长期个人背景下评估安全的重要性。警告:本文可能包含有害内容。

当个性化使风险正当化:揭示个性化对话智能体的安全漏洞
图2:用于评估个性化下安全性的 PS-Bench 概览。(a) 基础设置:在有害查询上评估一个由记忆增强的智能体。(b) 主题式聊天历史增强,通过合成的对话向用户记忆中添加持续的、良性的生活主题信号。(c) 基于人设的有害查询,基于角色档案与个人事件,以用户自然且与人设一致的方式表达不安全意图。