论文
SynCo:联合训练任务合成Agent与推理Agent
SynCo: Data Synthesis Co-Training for Self-Evolving LLMs via Multi-Agent Reinforcement Learning
摘要
自我进化的LLMAgent承诺通过持续的互动和学习来自主改进,减少对手动监督的依赖。实现这一承诺不仅需要更新代理,还需要随着其功能的变化而改进其训练体验。然而,大多数现有的管道依赖于静态数据集或单独更新的综合模型,导致以前有用的任务变得微不足道,而过于困难的任务仍然缺乏信息。Agent能力和培训经验之间日益不匹配的情况限制了持续的自我改进。为了解决这个问题,我们提出了 SynCo,一种 agentic 数据合成协同训练框架,用于基于多智能体强化学习的自我进化 LLM。 SynCo 联合优化两个独立的参数化代理:一个根据 Reasoner 不断发展的能力状态构建训练任务的 Synthesizer,以及一个从结果经验中学习的 Reasoner。每个合成任务都会引发多个 Reasoner 部署,其结果为两个代理提供互补的奖励。 正确性反馈改进了推理器,而任务质量、答案可靠性和基于结果的可教性指导了合成器。他们的更新会反馈到后续的综合轮次中,从而使任务解决策略及其训练分布能够共同发展。跨越八个数学推理基准的大量实验表明,SynCo 的性能大大优于现有的各种合成数据方法和受控基线,实现了最强的整体性能,同时从以前未解决的问题中获得了大部分收益。