论文

COvolve:基于双人零和博弈的大语言模型生成策略与环境的对抗式协同演化

COvolve: Adversarial Co-Evolution of Large-Language-Model-Generated Policies and Environments via Two-Player Zero-Sum Game

智能体系统Agent 架构与控制循环

摘要

构建持续改进的智能体的一个核心挑战在于:训练环境通常是静态的或由人工构建。这限制了持续学习以及向训练分布之外的泛化。我们用COvolve来应对这一问题,这是一个协同演化框架,利用大语言模型(LLM)同时生成环境与智能体策略,二者均表达为可执行的Python代码。我们将环境与策略设计者之间的交互建模为双人零和博弈,确保对抗式协同演化:环境暴露策略弱点,策略随之适应调整。这一过程诱导出自动课程,环境与策略在其中协同演化,复杂度不断提升。为在课程推进过程中保证鲁棒性并防止遗忘,我们计算该零和博弈的混合策略纳什均衡(MSNE),从而得到一个元策略。这一MSNE元策略确保智能体在学习解决先前未见环境的同时,不会遗忘如何解决已见过的环境。在城市驾驶、符号迷宫求解与几何导航上的实验表明,COvolve能够生成复杂度递增的环境。我们的结果证明了LLM驱动的协同演化在无需预定义任务分布或人工干预的情况下实现开放式学习的潜力。

COvolve:基于双人零和博弈的大语言模型生成策略与环境的对抗式协同演化:论文配图
图 1. 所提议的 COvolve 的概念概述,由环境设计师和策略设计师组成,通过玩两人零和游戏来共同进化。环境设计器生成越来越具有挑战性的环境(作为代码),而策略设计器创建策略(作为代码)来解决它们。混合策略纳什均衡通过持续适应实现稳健、开放式学习。