论文

PopuLoRA:面向推理自博弈的LLM种群协同演化

PopuLoRA: Co-Evolving LLM Populations for Reasoning Self-Play

模型训练强化学习RLVR

摘要

我们提出PopuLoRA,一个基于种群的非对称自博弈框架,用于大语言模型(LLM)可验证奖励强化学习(RLVR)后训练。教师与学生是共享冻结底座上的专用LoRA适配器:教师出题,配对的学生在程序化验证器下解题,子种群之间的交叉评估取代了限制单代理自博弈的自我校准。一族LoRA权重空间演化算子(能在数秒内产生同秩种群成员的变异与交叉)充当7B规模种群训练循环的替换步骤。我们在Absolute Zero Reasoner之上实例化PopuLoRA,并与按适配器计算量匹配的单代理基线比较。单代理会自我校准到生成自己能可靠求解的简单题,而种群则进入协同演化的军备竞赛:教师产出日益复杂的问题,学生解题率上下震荡,问题空间覆盖在整个训练过程中持续扩张。尽管训练时奖励更低,种群均值在三个代码基准(HumanEval+、MBPP+、LiveCodeBench)和七个数学基准(AIME 24/25、AMC 23、MATH-500、Minerva、GSM8K、OlympiadBench)上超越基线,甚至种群中最弱的成员在总体上也胜过基线。