论文
自进化算法设计Agent:通过群体策划的策略优化来逃避上下文中的进化停滞
Self-Evolving Algorithm-Design Agents: Escaping In-Context Evolutionary Stagnation via Population-Curated Policy Optimization
摘要
大语言模型越来越多地以算法设计Agent的形式参与复杂的现实世界任务,设计和完善算法。许多成功的算法设计Agent采用纯粹的上下文进化框架,但它们可能会在需要专业知识的领域迅速达到稳定水平。参数自适应提供了一种内化专业知识的方法,但传统训练需要丰富的特定领域语料库,而在复杂的算法设计场景中高质量的算法却很稀缺。在本文中,我们提出了样本有效的参数自进化,智能体可以从自生成的算法中探索和学习。首先,我们描述了上下文中的进化停滞,并分析性地提出了改进链命题,展示了学习连续的自生成算法如何能够局部增加邻近算法的可能性。受本地转移视角的推动,我们进一步提出群体策划策略优化(PCPO),利用全球群体和混合策略更新方案来保留和重用高质量、多样化的自生成算法,将策略转向更强的算法。在电子设计自动化中全局布局的学习率调度设计任务中,仅在 4 个芯片案例上进行训练,PCPO 在 16 个芯片案例中的平均表现优于最先进的上下文进化方法(例如 OpenEvolve 和 ShinkaEvolve)。 PCPO 凭借 8B 尺寸的基础模型,与 GPT-5.5 等前沿闭源模型相比,实现了具有竞争力的性能。 PCPO 还通过内化扎实的领域知识和快速蒸馏来降低推理时间词元成本。此外,PCPO 在四种 GPU 内核设计上实现了显着的加速,与 PyTorch Eager 基线相比平均加速了 8.27$\times$。