论文
你的智能体也在老化:面向已部署系统的智能体寿命工程
Your Agents Are Aging Too: Agent Lifespan Engineering for Deployed Systems
摘要
长寿命AI智能体日益作为持久运营系统被部署,但它们仍像刚初始化的模型一样被评估。首日基准遗漏了一个基本的系统问题:智能体部署后能保持可靠多久?即使模型权重冻结,智能体的有效状态也在持续变化:压缩交互历史、从不断增长的记忆库中检索、在更新后修订事实,并经历例行维护。因此,可靠性成为整个智能体Harness的寿命属性,而不仅是基础模型的快照属性。我们提出AgingBench,一个面向智能体寿命工程的纵向可靠性基准:不仅度量部署后的智能体是否退化,还度量退化采取何种形式以及修复应针对何处。AgingBench将智能体老化组织为四种机制:压缩老化、干扰老化、修订老化与维护老化。为诊断这些故障,AgingBench使用时间依赖图与成对反事实探针,为记忆管线的写入、检索与使用阶段生成诊断画像。在7个场景、14个模型、多种记忆策略以及运行器控制与自主两类智能体上,跨越8至200个会话的约400次运行表明,智能体老化不是一维的:行为测试可以保持干净而事实精度却在衰退;派生状态跟踪可能在单个模型内急剧崩溃;同一个错误答案所需的修复可能因诊断画像指向不同而不同。这些结果表明,可靠的智能体部署需要寿命评估、机制级诊断与分阶段针对性修复,而不仅是更强的首日模型。
