论文
MPBench:评测恶意内容如何写入Agent记忆并影响后续会话
From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents
摘要
记忆是AI Agent的核心组件,使其可以从多次交互中积累知识并改善表现,但持久记忆也引入投毒风险:一次恶意写入就可能长期影响Agent行为。本文系统研究大语言模型Agent的记忆投毒,识别四类写入通道,以及模型能力、系统提示设计和系统架构中使这些通道可被利用的九项结构性弱点。基于这些弱点,本文将记忆投毒划分为六类攻击,并设计评测基准MPBench。实验表明,更积极写入和检索记忆的Agent更容易被利用;现有提示注入防护也无法完整覆盖记忆投毒。研究为理解和缓解Agent记忆投毒提供了基础。
