论文

MemEvoBench:对 LLM 代理中内存错误演化带来的安全风险进行基准测试

MemEvoBench: Benchmarking Safety Risks from Memory Misevolution in LLM Agents

智能体系统模型评测Agent任务评测安全与风险评测

摘要

为大语言模型(LLM)配备持久内存增强了交互连续性和个性化,但引入了新的安全风险。具体来说,受污染或有偏见的记忆积累可能会引发异常的代理行为。现有的评估方法尚未建立测量记忆错误演化的标准化框架。这种现象是指由于反复接触误导性信息而导致的逐渐行为漂移。为了解决这一差距,我们引入了 MemEvoBench,这是第一个针对对抗性内存注入、嘈杂的工具输出和有偏见的反馈评估 LLM 代理中的长期内存安全性的基准。该框架由跨 7 个领域和 36 种风险类型的 QA 式任务组成,并辅以根据 20 个 Agent-SafetyBench 环境(具有嘈杂的工具返回)改编的工作流式任务。这两种设置都在多轮交互中使用混合良性和误导性内存池来模拟内存演化。对代表性模型的实验表明,在有偏差的内存更新下,安全性会显着下降。我们的分析表明,记忆进化是导致这些失败的一个重要因素。此外,基于静态提示的防御被证明是不够的,这凸显了保护 LLM 代理中的内存进化的紧迫性。