论文

CODE-SHARP:将技能作为分层奖励程序的持续开放式发现与演化

CODE-SHARP: Continuous Open-ended Discovery and Evolution of Skills as Hierarchical Reward Programs

模型训练合成数据

摘要

开发能够开放式发现和学习新技能的智能体是人工智能领域的一项巨大挑战。虽然强化学习为训练代理掌握复杂技能提供了强大的框架,但它通常依赖于手工设计的奖励函数。这对于开放式技能发现来说是不可行的,因为有意义的技能集是未知的。虽然最近的方法在自动化奖励函数设计方面显示出了有希望的结果,但它们仍然仅限于改进预定义任务的奖励。为了解决这一限制,我们引入了技能的持续开放式发现和进化作为分层奖励计划(CODE-SHARP),这是一种利用基础模型(FM)开放式扩展和完善分层技能档案的新颖框架,其结构为代码中可执行奖励函数的有向图。我们证明,一个目标条件智能体专门接受了所发现的 SHARP 技能所产生的奖励的训练,可以学习解决 Craftax 环境中日益增长的长期目标。当由基于 FM 的高级规划器组成时,发现的技能使单个目标条件代理能够解决复杂的长期任务,平均优于预训练代理和特定于任务的专家策略超过 134%%。我们将开源我们的代码并提供其他视频$\href{https://sites.google.com/view/code-sharp/homepage}{here}$。

CODE-SHARP:将技能作为分层奖励程序的持续开放式发现与演化
图1:CODE-SHARP由两个FM驱动的迭代过程组成,用于发现新颖的SHARP技能,并精炼技能档案中已有的SHARP技能。CODE-SHARP采用由基于FM的技能提案生成器、实现器与评判器组成的流水线,在环境评估之前先生成并过滤新颖的SHARP技能。技能精炼则依赖基于FM的技能变异生成器与实现器。技能变异提案随后直接在环境中接受评估。