论文

重新审视自我演进Agent的持续经验内化

Rethinking Continual Experience Internalization for Self-Evolving LLM Agents

模型训练持续学习

摘要

经验内化把过去交互中的上下文经验转化为可复用的参数化能力,为模型持续学习提供路径。以往研究主要关注单轮迁移;本研究发现,多轮经验学习时,已有方法出现逐步能力衰退,而非持续累积改善。研究从三个维度分析原因:(1)经验粒度:原则级经验比实例级经验更持久,能够抽象出可迁移策略,减少对特定轨迹细节的依赖;(2)注入方式:逐步骤注入明显优于全局注入,因为经验与中间决策状态更好对应,这对长程工具使用很重要;(3)内化方式:在高质量教师轨迹上进行离策略上下文蒸馏,比同策略上下文蒸馏提供更稳定的训练信号,后者受限于只能局部修正学生自身产生的缺陷状态。这些发现形成用于稳定、持续经验内化的方法组合,为自我演进和持续学习模型提供指导。