论文
教授 LLM 自我进化:通过强化学习培养核心元技能
Teaching LLMs to Self-Evolve: Cultivating Core Meta-Skills with Reinforcement Learning
摘要
正如 AlphaEvolve 所证明的那样,通过具有环境反馈的迭代自我进化来扩展测试时间,显示出显着的性能提升。我们假设这种进化框架的成功取决于元技能,例如通过环境反馈进行自我反思,这些元技能能够实现有效的多轮细化,但在很大程度上被传统的 后训练 所忽视。为了弥补这一差距,我们提出了 MetaEvolve,这是一个旨在通过数据合成管道、进化感知强化学习 (RL) 和推理时进化搜索来开发这些元技能的框架。具体来说,我们将 MetaEvolve 植根于编码,其中程序执行提供了超越二进制正确性的自然、连续的奖励信号。基于这些信号,我们合成进化轨迹作为训练数据,每个轨迹都包含当前程序、其适应度得分(结合正确性和效率)以及先前尝试的历史,并通过 RL 训练模型,并使用从测试用例执行中获得的可验证奖励。通过对大规模代码数据进行训练,我们的目标是激发可推广的与领域无关的元技能,这些元技能可以广泛地应用于缺乏如此丰富的训练信号的开放式问题。在七个编码基准测试中,MetaEvolve 在分布内任务上比最强基线高出 10.01%,在分布外任务上比最强基线高出 24.12%。在完全超出训练领域的开放式算法优化问题上,它进一步实现了 46.9% 的相对改进。这些结果表明,明确培养自我进化元技能为实现能力更强、自主自我进化的人工智能提供了一条原则性道路。