论文

EVOM:强化学习的 Actor-Critic 架构的代理元进化

EVOM: Agentic Meta-Evolution of Actor-Critic Architectures for Reinforcement Learning

模型架构新型架构

摘要

在行动者批评家强化学习中,网络架构通常是手动设计的。自动化此设计具有挑战性,因为每个候选人都必须在评估之前接受培训,并且设计空间是开放式的。为了应对这些挑战,我们引入了 EVOM,这是一种用于发现高性能 Actor-Critic 架构的代理元进化框架。我们将架构搜索构建为双层优化:内循环通过低保真近端策略优化(PPO)训练权重,而外循环通过迭代细化架构程序来驱动元进化。至关重要的是,这个外环由基于 LLM 的设计代理提供支持,该代理纯粹作为架构设计师运行,与策略执行和环境控制完全解耦。实验表明,EVOM 的性能优于手动设计的基线、LLM 引导的随机搜索和最先进的 LLM 引导的编程策略搜索方法 MLES,在 Ant-v4 和 HalfCheetah-v4 上提供卓越的性能。消融研究验证了元进化循环和 LLM 设计代理对于最终性能都是不可或缺的。