论文
MIND:通过意图感知信息瓶颈实现轻量有效的LLM智能体记忆注入防御
MIND: Lightweight and Effective Memory Injection Defense for LLM Agents via Intent-Aware Information Bottleneck
摘要
基于 LLM 的记忆增强智能体容易受到记忆注入攻击:智能体可能检索到攻击者投放的投毒记忆,使其行为偏离用户初始意图,最终导致任务失败。然而,现有防御机制要么计算成本高昂,要么在多轮上下文中受信息冗余困扰。为应对这些挑战,我们提出 Memory Intent-Aware Neural Denoising(MIND),一个针对记忆注入攻击的轻量级防御框架。我们的初步分析表明,良性轨迹与投毒轨迹在用户初始意图与后续行为之间的关系上呈现可区分的差异。基于这一观察,MIND 采用意图感知的信息瓶颈(Information Bottleneck,IB),从初始意图与轮级行为中提取紧凑的意图—行为表示。该信息瓶颈在过滤与任务无关及重复信息的同时,保留与意图相关的跨轮攻击信号,再由轻量检测器从所得表示中识别恶意记忆。由此,MIND 既缓解了多轮上下文中的信息冗余,又避免了反复调用 LLM 审计的开销。大量实验表明,MIND 在保持任务准确率与推理效率的同时降低了攻击成功率。值得注意的是,在 ReAct-StrategyQA 上,MIND 将平均 ASR-r 和 ASR-a 分别降低 55.4% 和 55.3%,同时在平均准确率与延迟上与无防御智能体持平。
