论文

MemSecBench:追踪记忆投毒的行为后果与选择性修复

MemSecBench: Tracking Agent Memory Poisoning from Persistence to Consequence and Repair

模型评测上下文与知识智能体系统记忆Agent 动作执行与治理安全与风险评测Agent记忆

摘要

记忆系统让Agent保留并复用过去交互中的信息,也可能使恶意内容长期存在。攻击者构造的指令可能被写入长期记忆,过很久才被调用,并悄然影响实际动作。近期基准越来越关注记忆安全,但很少在多种记忆后端下,沿同一恶意内容追踪持久保存、后续后果与选择性修复。本文提出面向任务的全生命周期安全基准MemSecBench,包含来自代码与科学、日常生活和办公三个领域48种情境的310个案例。每个案例在隔离运行环境和固定Agent配置下遵循写入、执行、遗忘协议;配置由运行框架、记忆后端和模型后端共同确定。评判结合确定性的写入检查、分检查点的模型评估和程序门禁,覆盖七个生命周期检查点。实验涵盖两个运行框架、四个记忆后端和三个模型后端组成的24种配置。跨配置统计中,恶意记忆在84.2%的案例中持久存在,完整写入—执行链的成功率为50.3%。在成功投毒的案例中,59.6%完成完整执行链,56.1%实现选择性修复。与匹配的原生记忆配置相比,端到端攻击成功率与选择性修复率的最大绝对差异分别为16.1和41.3个百分点。这些描述性比较说明,不同系统配置在恶意记忆传播和投毒后的选择性修复方面存在差异。

MemSecBench:追踪记忆投毒的行为后果与选择性修复 配图
图1:临时指令丢失时效信息后形成错误长期规则,以及定向修复。