论文
程序综合智能体中面向分层规划的学习抽象
Learning Abstractions for Hierarchical Planning in Program-Synthesis Agents
摘要
人类学习抽象并利用它们高效规划,从而快速跨任务泛化——这种能力对最先进的大语言模型(LLM)智能体与深度强化学习(RL)系统仍具挑战。受关于人如何形成抽象与世界知识直觉理论的认知科学启发,基于理论的 RL(TBRL)系统(如 TheoryCoder)通过对抽象的有效运用表现出强泛化。然而,它们严重依赖人工提供的抽象,回避了抽象学习问题。我们提出 TheoryCoder-2,一个新的 TBRL 智能体,它利用 LLM 的上下文学习能力,通过从经验中综合抽象并将其融入分层规划过程,主动学习可复用抽象而非依赖人工指定。我们在多样环境中开展实验,包括 BabyAI、Minihack 以及 Sokoban 等 VGDL 游戏。我们发现,TheoryCoder-2 比用经典规划域构建、基于推理的规划以及 WorldCoder 等既有程序综合智能体增强的基线 LLM 智能体显著更省样本。TheoryCoder-2 能解开基线失败的复杂任务,同时与既有 TBRL 系统不同,只需极少的人工提示。
