论文

程序综合智能体中面向分层规划的学习抽象

Learning Abstractions for Hierarchical Planning in Program-Synthesis Agents

智能体系统Agent 规划

摘要

人类学习抽象并利用它们高效规划,从而快速跨任务泛化——这种能力对最先进的大语言模型(LLM)智能体与深度强化学习(RL)系统仍具挑战。受关于人如何形成抽象与世界知识直觉理论的认知科学启发,基于理论的 RL(TBRL)系统(如 TheoryCoder)通过对抽象的有效运用表现出强泛化。然而,它们严重依赖人工提供的抽象,回避了抽象学习问题。我们提出 TheoryCoder-2,一个新的 TBRL 智能体,它利用 LLM 的上下文学习能力,通过从经验中综合抽象并将其融入分层规划过程,主动学习可复用抽象而非依赖人工指定。我们在多样环境中开展实验,包括 BabyAI、Minihack 以及 Sokoban 等 VGDL 游戏。我们发现,TheoryCoder-2 比用经典规划域构建、基于推理的规划以及 WorldCoder 等既有程序综合智能体增强的基线 LLM 智能体显著更省样本。TheoryCoder-2 能解开基线失败的复杂任务,同时与既有 TBRL 系统不同,只需极少的人工提示。

程序综合智能体中面向分层规划的学习抽象
图2:我们实验中使用的课程(curriculum)示意。课程是一系列回合(episode)的序列,其中每个回合包含一个或多个环境/游戏。第一个回合(Labyrinth)与第二个回合(Maze 和 Sokoban)的序列在实验 1(Sec. 4.1)中研究,而整个序列用于实验 2(Sec. 4.2)。在实验 3(Minihack)中,我们使用单独的课程。蓝色箭头表示 TheoryCoder-2 学到的抽象。