论文

CoEvolve:通过智能体数据相互演化训练 LLM 智能体

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

模型训练强化学习

摘要

LLM智能体的强化学习通常在静态数据分布上进行,这无法适应智能体不断变化的行为,并导致对复杂环境交互的覆盖率较差。为了应对这些挑战,我们提出了 CoEvolve,一种智能体-数据相互进化框架,使 LLM 智能体能够通过闭环、交互驱动的训练进行改进。具体来说,CoEvolve 从采样轨迹中提取遗忘和不确定性等反馈信号,以识别容易失败的交互模式,并利用它们来指导基于 LLM 的任务合成。合成的任务通过环境交互进行验证,并用于更新数据分布,从而实现代理及其数据的联合适应。在 Qwen2.5-7B、Qwen3-4B 和 Qwen3-30B-A3B 上的 AppWorld 和 BFCL 上进行的广泛实验表明,与强基础模型相比,取得了一致且显着的改进,分别获得了 19.43%、15.58% 和 18.14% 的绝对增益。