论文

COEVO:在同一反馈循环中协同更新模型参数与上下文

COEVO: Co-Evolving Context and Parameters for Recursive Self-Improvement

模型训练上下文与知识智能体系统强化学习上下文工程智能体自我改进递归自我改进(RSI)

摘要

递归自我改进(RSI)旨在将大语言模型从静态训练管道转移到可以参与改善其自身未来行为的系统。现有的方法主要遵循两个方向:通过在线学习更新模型参数,或者通过搜索、反射和提示优化来改善外部上下文。尽管这两种机制都可以支持持续改进,但它们通常是独立研究的。这种分离忽略了一个重要的交互:上下文塑造了模型学习的经验,而不断发展的模型可能会随着时间的推移以不同的方式解释和利用相同的上下文。因此,我们将 RSI 表述为参数-上下文协同进化问题,其中模型参数和学习上下文在共享反馈循环中适应。我们引入了 COEVO,这是一个框架,可以根据策略经验更新模型参数,同时根据不断发展的策略状态调整上下文指导。策略熵和即时条件注意力被用作指导这种适应的补充信号。实验表明,与固定上下文强化学习相比,COEVO 持续提高了任务性能,并生成对系统提示变化更稳健的策略。更广泛地说,我们的结果表明,外部上下文不应仅仅被视为大语言模型的固定接口,而应被视为递归自我改进的自适应组件。