论文

训练语言代理从经验中学习

Training Language Agents to Learn from Experience

模型训练强化学习

摘要

语言代理可以根据交互环境中的经验进行适应,但当前基于反射的方法只能在单个任务实例中进行自我纠正。这些经验是否可以提炼成可重复使用的经验教训,以提高未来未见任务的表现,目前尚不清楚。我们通过引入上下文训练(ICT)任务来解决这个问题,这是一个评估语言智能体跨任务自我改进的框架。在 ICT 中,反射器模型观察参与者模型收集的轨迹,并生成系统提示,旨在提高参与者在未来未见过的任务中的表现。然后,我们提出了一种基于强化学习的训练管道,用于直接从经验中学习此类反思,而无需人工提供的示例。在 ALFWorld 和 MiniHack 中,我们训练有素的反射器在大多数保留的任务系列上都优于未经训练的基线,这表明从经验中学习的能力本身是可以学习的。在某些情况下,我们观察到泛化超出了反射器训练的基准,扩展到截然不同的环境。最后,我们介绍 MetaGym,一个用于构建元环境的通用 Python 库,使未来的自我改进语言代理研究成为可能。