论文

通过大语言模型进化搜索发现强化学习算法

Evolutionary Discovery of Reinforcement Learning Algorithms via Large Language Models

应用与实践科学研究

摘要

强化学习算法由其学习更新规则定义,这些规则通常是手工设计和固定的。我们提出了一个进化框架,用于通过直接搜索实现完整训练过程的可执行更新规则来发现强化学习算法。该方法基于 REvolve(一种使用 大语言模型 作为生成变异算子的进化系统),并将其从奖励函数发现扩展到算法发现。为了促进非标准学习规则的出现,搜索排除了规范机制,例如Actor–Critic结构、时间差异损失和价值引导。由于强化学习算法对内部标量参数高度敏感,因此我们引入了进化后细化阶段,其中 大语言模型 为每个进化的更新规则提出可行的超参数范围。通过在多个 Gymnasium 基准上运行完整训练进行端到端评估,发现的算法相对于既定基准(包括 SAC、PPO、DQN 和 A2C)实现了具有竞争力的性能。