论文
使用 大语言模型 发现强化学习接口
Discovering Reinforcement Learning Interfaces with Large Language Models
摘要
强化学习系统依赖于指定观察和奖励函数的环境接口,但为新任务构建这些接口通常需要大量的手动工作。虽然最近的工作使用 大语言模型 (LLM) 进行自动化奖励设计,但这些方法假设观察是固定的,并且不能解决合成完整任务界面的更广泛挑战。我们从原始模拟器状态研究强化学习任务接口发现,其中必须生成观察映射和奖励函数。我们提出了 LIMEN(代码可在 https://github.com/Lossfunk/LIMEN 获取),这是一个 LLM 引导的进化框架,它将候选接口生成为可执行程序,并使用策略训练反馈迭代地完善它们。在新颖的离散网格世界任务和跨越运动和操纵的连续控制域中,观察和奖励的联合进化发现了仅给出轨迹级成功指标的有效接口,而单独优化任一组件在至少一个域上失败了。这些结果表明,从原始状态自动构建 RL 接口可以大大减少手动工程,并且观察和奖励组件通常受益于协同设计,因为单组件优化在我们的评估套件中的至少一个领域上会发生灾难性的失败。