论文

顺从陷阱:诊断AI智能体如何消费冲突记忆

The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

记忆正成为长程AI智能体的核心组件:让智能体在操作网页浏览器、软件工具与其他交互环境时复用既往经验。既有工作大多把记忆当作供给问题——写什么经验、如何存储、为下一任务检索哪条。但我们仍缺乏对模型在多步动作轨迹中如何消费被检索记忆的清晰刻画。这一消费过程之所以重要,是因为它不仅决定应检索哪些记忆,还决定安全使用它们需要什么模型与控制策略。为诊断该过程,我们提出入口—传播—恢复(E-P-R)框架:追问记忆首次改变动作的位置、该改变是否持续、以及智能体离开正确路径后能否恢复。我们在WebArena与我们构建的受控基准MemTrapBench上实例化E-P-R。发现:主要失败常始于入口——智能体在第一个暴露的决策点就采纳冲突记忆,即使它对任务是错的;重复暴露放大这一早期错误,而分歧后的恢复很弱。这些效应共同制造一个顺从陷阱:跨模型,冲突记忆诱导相似的顺从率;但一旦顺从,成功率就塌到低地板——因此更强的模型承受更大的绝对损害,因为每次顺从抹去的基线能力更多。结果表明:记忆增强智能体的评估不应只看检索质量或最终成功率,还应看它们在整条轨迹中如何消费记忆。