论文

RLDiscover:用LLM共同改进强化学习算法组件

RLDISCOVER: LLM-driven co-evolution of reinforcement learning algorithms

应用与实践智能体系统智能体自我改进科学研究

摘要

LLM引导的程序进化使数学和计算优化方面的发现成为可能,提高了强化学习(RL)算法的前景,这种算法可以自我进化以改善智能体的学习方式。然而,实现这一前景面临两个障碍。对耦合算法组件的联合搜索很难扩展:同时发生的变化会扰乱学习,而孤立的变化则忽略了它们的依赖性。评估候选算法还需要昂贵的训练,随机种子的适应性仍然不确定。我们引入了 RLDiscover,一个用于无模型深度 RL 算法自我进化的框架。渐进式协同进化从有针对性的组件编辑发展到联合进化,而渐进式概率评估则通过分阶段训练和重复评估来平衡搜索广度和评估保真度。 SAC、PPO 和 DQN 在四个基准套件上进行的实验显示,平均回报率有了显着改善,每个家庭的中值收益为 32%-84%,峰值回报率约为 363 倍(较接近于零的基线)。这些收益包括从失败的学习到成功完成任务的转变,以及当从更强大的开源实现开始发展时,改进会持续存在。在测量的 SAC 运动运行中,评估大约使用完全评估同一候选池所需的估计计算量的十五分之一。值得注意的是,独立搜索反复发现可解释的自适应稳健损失、依赖于进度的价值目标和运行统计数据的组合,并将选定的程序转移到看不见的任务。这些发现表明自我进化在人工智能中发挥着更广泛的作用:发现可解释的算法来改善智能体的学习方式。

RLDiscover:用LLM共同改进强化学习算法组件:论文原图
图 1:RLDiscover 概述。左:RL 算法的 5 个算法组件(状态表示、价值估计、批评学习、策略优化、探索)。中:PCE 独立演化组件(第 1 阶段,UCB1 选择),然后共同共同演化(第 2 阶段)。右图:PPE 通过 L0→\toL1→\toL2 过滤候选者,因此只有通过廉价筛选的候选者才会消耗完整的训练运行。上图:LLM 变异引擎根据性能反馈生成代码变体。