论文
记忆作为LLM智能体的攻击面:多选题问答研究
Memory as an Attack Surface in LLM Agents: A Study on Multiple-Choice Question Answering
摘要
AI智能体把语言理解与任务执行、外部工具使用及记忆机制整合——扩展了传统大语言模型(LLM)应用。虽然记忆使智能体保留先前交互并提供更个性化、情境感知的响应——它也引入新漏洞:存储在记忆中的信息可影响未来输出——即使当前查询是干净的。本文研究基于LLM的智能体在多选题问答中的记忆操纵。我们首先设计并实现带外部记忆组件的LLM智能体——存储与检索任务相关信息。然后引入基础记忆操纵场景——在智能体回答多选题前把误导或损坏的记忆插入其中。经受控实验设定——我们比较记忆操纵前后智能体的表现——测量答案准确率、攻击成功率与被操纵选项选择的变化。结果表明即使简单的记忆操纵也能显著影响智能体最终答案——使其在收到干净良构问题时仍选择错误选项。
