论文

通过自适应记忆参数协调学习LLM自演化中何时记忆、何时内化

Learning What to Remember and What to Internalize in LLM Self-Evolution via Adaptive Memory-Parameter Coordination

智能体系统上下文与知识记忆Agent 架构与控制循环智能体自我改进Agent记忆

摘要

大语言模型代理在动态环境中运行,工具接口、API和用户需求在部署后会发生变化。现有的自我进化方法主要遵循两种范式:外挂范式,通过将反馈外化到可编辑的记忆或技能来实现快速适应,内挂范式,通过将经验内化到模型参数中来实现更深层次的能力提升。然而,使用这两种范式中的任一种都会导致灵活性和性能之间的权衡。本文提出了一种统一的代理自我进化框架COVE,通过任务导向的路由、阶段导向的调度和知识优化,将外挂范式和内挂范式的学习机制结合起来。通过这种方式,COVE 不再将自我进化视为经验的无差别积累,而是视为一个协调的过程,将任务和知识类型匹配到适当的学习机制。在多个任务类别上的实验结果表明,COVE 在变化的环境中比单通道进化策略表现更好,展示了更稳健和高效的改进。

通过自适应记忆参数协调学习LLM自演化中何时记忆、何时内化:论文配图
图1:基于 Harness 的演化保留可编辑的记忆或技能,而基于参数的演化更新模型权重。