论文
SAGE:面向LLM推理的多智能体自我进化
SAGE: Multi-Agent Self-Evolution for LLM Reasoning
摘要
基于可验证奖励的强化学习能够提升大语言模型(LLM)的推理能力,但许多方法仍依赖大规模人工标注数据集。尽管自我博弈降低了这种依赖,但往往缺乏显式规划和严格的质量控制,限制了长程多步推理的稳定性。我们提出SAGE(Self-evolving Agents for Generalized reasoning Evolution),这是一个闭环框架,其中四个智能体——挑战者(Challenger)、规划者(Planner)、求解者(Solver)与批评者(Critic)——仅使用一个小型种子集,从共享的LLM骨干出发协同进化。挑战者持续生成难度不断提升的任务;规划者将每个任务转化为结构化的多步计划;求解者按照计划生成答案,其正确性由外部验证器判定。批评者对生成的问题和计划进行打分与过滤,以防止课程漂移并维持训练信号质量,从而实现稳定的自我训练。在数学与代码生成基准上,SAGE在不同模型规模下均带来一致提升,将Qwen-2.5-7B模型在LiveCodeBench上提升8.9%,在OlympiadBench上提升10.7%。
