论文
使用行为树和 LLM 对组合任务进行奖励塑造和动作屏蔽
Reward Shaping and Action Masking for Compositional Tasks using Behavior Trees and LLMs
摘要
将复杂的任务分解为一系列更简单的子任务可以提高自主代理的学习效率。强化学习(RL)可用于优化代理策略以完成子任务,但需要明确定义的子任务奖励和动作屏蔽的好处。最近的工作使用 大语言模型 (LLM) 来自动化奖励塑造和动作屏蔽,但是它们都没有完全解决对子任务失败的反应性以及对组合任务的不同对象的模块化。为了克服这些挑战,我们开发了掩蔽奖励行为树(MRBT),这是一种用作反应性和模块化奖励和动作掩蔽函数的符号结构。我们设计了一个 MRBT 模板并导出逻辑规范来构建和验证一系列对象交互子任务的 MRBT。此外,我们开发了一个自动化管道,它使用 LLM 生成对不同任务对象稳健的 MRBT,使用 SMT 求解器来验证规范的正确性,并使用神经符号 RL 循环来训练代理执行组合任务。实验证明了五个 MRBT 的成功生成和细化,与基线和没有动作屏蔽的 MRBT 相比,持续提高了训练效率和任务成功率。我们进一步强调了 MRBT 的三个优势:可转移性、模块化和可验证性。