论文

在职学习:冻结权重智能体从部署反馈中持续学习

Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents

上下文与知识记忆Agent记忆

摘要

AI 智能体在其运行的每一回合中都会遇到学习机会,却几乎将其全部丢弃:底层模型在部署时被冻结,因此今天解决了某个困难请求的智能体,明天该请求再次出现时仍从零开始。然而日常运行本身就会产生反馈,形式是结果判定与事后纠正。我们证明,当冻结模型与一个把每回合经验提炼为可检索自然语言规则的外部记忆配对时,这种反馈就是持续学习的充分信号。在 $τ$-bench 的银行领域,对照在完整政策语料上检索的静态 RAG,从一比特的结果判定中学习可将单次尝试成功率提升至基线的 1.6$ imes$,从纠正中学习可提升至 2.6$ imes$,并攻克了基线从未解决的 84 个任务中的 22 个。该结果横跨部署光谱:在 Mistral Large(有数据主权要求的组织可自托管的开源权重模型)上测得,并在前沿模型 Claude Sonnet 5 上复现。累积的记忆还能迁移:每个模型在读取对方构建的记忆库后,均高于自身无记忆的基线。测试框架、协议与数据均已发布。