论文

OPD-Evolver:通过 同策略 蒸馏 培养整体代理 Evolver

OPD-Evolver: Cultivating Holistic Agent Evolver via On-Policy Distillation

模型优化上下文与知识记忆蒸馏Agent记忆

摘要

记忆已成为自我进化主体的标准基础,但保留经验并不等同于学习如何通过经验进化。现有的记忆代理可以存储轨迹、检索反射或积累技能,但通常缺乏选择有用经验、对其采取行动、编写可重用知识以及维护不断增长的存储库的整体能力。我们介绍 OPD-Evolver,一个慢速协同进化框架,通过 同策略 self-蒸馏 培养这样的智能体进化者。在快速循环中,OPD-Evolver 与四级内存层次结构交互,以读取、使用、写入和维护快速测试时间演进的体验。在慢循环中,结果校准的记忆归因和特权后见之明将这四种能力提炼成可部署的策略。在多领域基准测试中,OPD-Evolver 超过 ReasoningBank 等内存系统高达 11.5%,超过 Skill0 等基于训练的方法约 5.8%。进一步分析表明,OPD-Evolver 内化了高价值的体验和内存管理,使 OPD-Evolver-9B 能够挑战 Qwen3.5-397B-A17B 和 Step-3.5-Flash 等巨头,超越内存增强代理,走向真正合格的代理进化者。