论文
当个性化使风险正当化:揭示个性化对话智能体的安全漏洞
When Personalization Legitimizes Risks: Uncovering Safety Vulnerabilities in Personalized Dialogue Agents
摘要
长期记忆使大语言模型 (LLM) 代理能够支持个性化和持续的交互。然而,大多数关于个性化代理的工作都优先考虑实用性和用户体验,将内存视为中立的组成部分,并在很大程度上忽视了其安全影响。在本文中,我们揭示了意图合法化,这是个性化代理中先前未充分研究的安全故障,其中良性的个人记忆会偏差意图推断,并导致模型将固有有害的查询合法化。为了研究这一现象,我们引入了 PS-Bench,这是一个旨在识别和量化个性化交互中意图合法性的基准。在多个内存增强代理框架和基础大语言模型中,相对于无状态基线,个性化将攻击成功率提高了 15.8%-243.7%。我们进一步从内部表示空间为意图合法化提供了机械证据,并提出了一种轻量级的检测反射方法,可以有效减少安全退化。总的来说,我们的工作首次系统地探索和评估了意图合法性作为一种安全失败模式,这种模式自然产生于良性的、现实世界的个性化,强调了在长期个人背景下评估安全的重要性。警告:本文可能包含有害内容。
