论文

PACEvolve++:改进进化搜索代理的测试时学习

PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents

模型训练强化学习

摘要

大语言模型 已成为进化搜索的驱动力,但大多数系统依赖于固定的、提示引发的策略来对下一个候选者进行采样。这限制了实际工程和研究任务的适应,其中评估成本高昂,并且进展取决于学习特定任务的搜索动态。我们引入了 PACEvolve++,这是一种顾问模型强化学习框架,用于进化搜索代理中的测试时策略适应。 PACEvolve++ 将战略搜索决策与实施分离:可训练的顾问生成、评估和选择假设,而更强大的前沿模型将选定的假设转化为可执行的候选假设。为了在非平稳反馈下训练顾问,我们提出了一种阶段自适应方法,使其优化策略适应进化过程的不同阶段。在进化的早期,它使用群体相关反馈来了解广泛的搜索偏好;后来,随着奖励差距的缩小,它强调最好的 $k$ 前沿贡献以支持稳定的改进。在专家并行负载平衡、顺序推荐和蛋白质适应度外推方面,PACEvolve++ 凭借前沿模型优于最先进的进化搜索框架,在进化搜索过程中实现更快的收敛并稳定测试时训练。