论文
AGAR:以强化学习框架组织LLM程序演化
AGAR: a reinforcement learning substrate for LLM program evolution
摘要
给定一个任务和一个评估器,语言模型可以重写候选程序,同时搜索循环决定哪些重写可以生存,从而为算法发现提供了一条实用的途径。但这个循环是由手动设置的五个常量控制的:选择哪个父代、变异的难度、如何保持多样性、要记住什么,以及一个标量分数,该分数永远不会说明程序的哪一部分赢得了它。强化学习已经为每个都有一个估计器。障碍在于,程序的演化通常不会被写成决策过程。我们将其形式化为马尔可夫决策过程,其操作是模型所依赖的模块化前缀,而不是它发出的程序。然后,信用分配、价值评估、自适应探索和经验记忆可以附加到不同的组件上。 AGAR(强化学习算法生成)提供了结果基础:无需更改控制器即可更换或关闭任何估计器,从而使传输一次可审核一种机制,而无需对后端模型进行梯度训练。在 19 项任务、两个后端和一个工具下的三个种子中,AGAR 改进了大多数任务的两个已发布基线中更强的一个,其中收益集中在竞争性编程系列中。形式化还产生了对先前工作的可检查的解读:这些系统隐式地是零折扣,不是出于选择,而是因为适应性对于个人来说是外生的,而不是对继任者的回报,因此折扣因素没有任何作用。
