论文

LEACL:LLM-增强自动课程学习,用于长视野操作任务中的强化学习

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

智能体系统Agent 规划

摘要

由于稀疏的奖励信号和长视野,长视野操作任务对强化学习提出了重大挑战。自动课程学习(ACL)被提出来应对这些挑战,通过逐步训练智能体执行一系列任务,从简单到困难。然而,ACL 的成功在很大程度上取决于任务相关的规范,例如明确定义的任务参数空间和难度度量,这些规范通常是手动制定的,并且难以在不同的任务中推广。 大语言模型 (LLM) 的最新进展提供了一种有前途的替代方案,通过使用 LLM 的网络规模常识知识将复杂任务分解为有意义的子任务。这种分解可以为长期任务的有效学习提供自然的课程结构。然而,现有的基于 LLM 的方法通常依赖于手工设计的密集奖励函数来学习每个子任务,这可能会引入偏差,并且仍然需要大量的人工监督。在这项工作中,我们提出了 LLM 增强型自动课程学习(LEACL),这是一个集成 LLM 和 ACL 的框架来解决这些限制。具体来说,LLM 用于将任务分解为子任务并为每个子任务生成任务相关的规范。然后,ACL 算法使用这些规范来指导仅使用稀疏奖励信号的学习,从而消除了密集奖励设计的需要。我们在 LIBERO 基准的五个长期操作任务上评估 LEACL。与人类设计的密集奖励相比,LEACL 在成功率方面取得了更好的渐近性能。