论文
递归代理优化
Recursive Agent Optimization
摘要
我们引入了递归代理优化(RAO),这是一种用于训练递归代理的强化学习方法:可以递归地生成子任务并将其委托给自身的新实例的代理。递归代理实现了推理时间缩放算法,该算法自然地允许代理扩展到更长的上下文,并通过分治法推广到更困难的问题。 RAO 提供了一种训练模型的方法,以最好地利用这种递归推理,指导代理何时以及如何进行委派和通信。我们发现,以这种方式训练的递归代理具有更好的训练效率,可以扩展到超出模型上下文窗口的任务,泛化到比代理训练的任务难得多的任务,并且与单代理系统相比,可以减少挂钟时间。