论文

AGAR:以强化学习框架组织LLM程序演化

AGAR: a reinforcement learning substrate for LLM program evolution

智能体系统Agent 规划智能体自我改进递归自我改进(RSI)

摘要

给定一个任务和一个评估器,语言模型可以重写候选程序,同时搜索循环决定哪些重写可以生存,从而为算法发现提供了一条实用的途径。但这个循环是由手动设置的五个常量控制的:选择哪个父代、变异的难度、如何保持多样性、要记住什么,以及一个标量分数,该分数永远不会说明程序的哪一部分赢得了它。强化学习已经为每个都有一个估计器。障碍在于,程序的演化通常不会被写成决策过程。我们将其形式化为马尔可夫决策过程,其操作是模型所依赖的模块化前缀,而不是它发出的程序。然后,信用分配、价值评估、自适应探索和经验记忆可以附加到不同的组件上。 AGAR(强化学习算法生成)提供了结果基础:无需更改控制器即可更换或关闭任何估计器,从而使传输一次可审核一种机制,而无需对后端模型进行梯度训练。在 19 项任务、两个后端和一个工具下的三个种子中,AGAR 改进了大多数任务的两个已发布基线中更强的一个,其中收益集中在竞争性编程系列中。形式化还产生了对先前工作的可检查的解读:这些系统隐式地是零折扣,不是出于选择,而是因为适应性对于个人来说是外生的,而不是对继任者的回报,因此折扣因素没有任何作用。

AGAR:以强化学习框架组织LLM程序演化:论文原图
图 2:基材。顶部:流循环 - 填充 WW 槽位,等待任何完成,立即调度替换 - 控制器作为人口的唯一写入者,并且 WW 飞行中的部署读取调度时快照并仅写入自己的轨迹。四个管道阶段(选择、生成、评估、判断)是基底的;可更换模块位于所选插槽中。共享资源池每次使用时都会获取并返回。底部:本文中使用的三个时刻中的相同循环,τ\tau 定义为调度和着陆之间的群体版本差异。