论文

你的智能体也在老化:面向已部署系统的智能体寿命工程

Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems

智能体系统上下文与知识记忆Agent HarnessAgent任务评测Agent记忆

摘要

长寿命AI智能体日益作为持久运营系统被部署,但它们仍像刚初始化的模型一样被评估。首日基准遗漏了一个基本的系统问题:智能体部署后能保持可靠多久?即使模型权重冻结,智能体的有效状态也在持续变化:压缩交互历史、从不断增长的记忆库中检索、在更新后修订事实,并经历例行维护。因此,可靠性成为整个智能体Harness的寿命属性,而不仅是基础模型的快照属性。我们提出AgingBench,一个面向智能体寿命工程的纵向可靠性基准:不仅度量部署后的智能体是否退化,还度量退化采取何种形式以及修复应针对何处。AgingBench将智能体老化组织为四种机制:压缩老化、干扰老化、修订老化与维护老化。为诊断这些故障,AgingBench使用时间依赖图与成对反事实探针,为记忆管线的写入、检索与使用阶段生成诊断画像。在7个场景、14个模型、多种记忆策略以及运行器控制与自主两类智能体上,跨越8至200个会话的约400次运行表明,智能体老化不是一维的:行为测试可以保持干净而事实精度却在衰退;派生状态跟踪可能在单个模型内急剧崩溃;同一个错误答案所需的修复可能因诊断画像指向不同而不同。这些结果表明,可靠的智能体部署需要寿命评估、机制级诊断与分阶段针对性修复,而不仅是更强的首日模型。

你的智能体也在老化:面向已部署系统的智能体寿命工程:论文配图
图 1:部署后的四种老化机制。左:第一天的互动被写入记忆中。中心:特定机制的老化曲线。右图:day-NN 探测揭示了不同的面向用户的故障。 (a) 压缩:写入时摘要会丢弃与未来相关的细节,从而产生遗漏。 (b) 干扰:累积的相似条目挤出了目标事实,产生混乱。 (c) 修订:更改或导出的状态未正确更新,产生陈旧的答案。 (d) 维护:例行生命周期事件,例如内存重新压缩或历史记录刷新触发回归。