论文

选择行动:通过自适应语言指导进行分层强化学习

Select-to-Act: Hierarchical Reinforcement Learning via Adaptive Language Guidance

模型训练强化学习

摘要

强化学习(RL)已广泛应用于顺序决策,但由于与环境的交互成本高昂,样本效率往往较低。最近的一些工作已经开始探索通过利用以自然语言指令表达的外部知识来提高强化学习效率。然而,现有的少数方法通常将整个指令视为单个条件输入,未能考虑语言指导的阶段依赖性质,尤其是在复杂的环境中。在本文中,我们提出了 \emph{使用语言指令进行分层强化学习(HRLLI)},这是一种分层强化学习框架,可将自然语言指令显式建模为决策过程中动态可选择的语义指导。 HRLLI 将指令分解为一组分段指导元素,其中每个指令片段可能在与环境交互的不同阶段变得相关。然后,在 \emph{Select-to-Act} 范式中制定了一种新颖的分层强化学习策略结构:高级语义策略充当指导选择器,选择与当前状态最相关的指令片段来指导底层智能体的决策,而底层策略则根据所选指导执行环境操作。同时学习两级策略,以最大限度地提高与环境相互作用的预期回报。这种设计使代理能够在交互过程中自适应地将语言指令转化为特定于阶段的决策。指令密集型 RTFM 基准测试表明,HRLLI 始终优于强指令条件 RL 基线,这表明显式建模自适应指令选择可显着提高 RL 的有效性。