论文

LLM 辅助的语义选项发现以促进自适应深度强化学习

LLM-assisted Semantic Option Discovery for Facilitating Adaptive Deep Reinforcement Learning

智能体系统Agent 架构与控制循环

摘要

尽管深度强化学习(DRL)在复杂任务中成绩卓著,但在实际应用中仍存在数据效率低、缺乏可解释性、跨环境迁移性有限等关键问题。然而,基于状态生成动作的习得策略对环境变化敏感,难以保证行为的安全与合规。近期研究表明,将大语言模型(LLM)与符号规划结合有望应对这些挑战。受此启发,我们提出一个新颖的 LLM 驱动闭环框架,通过把自然语言指令映射为可执行规则并对自动创建的选项进行语义标注,实现语义驱动的技能复用与实时约束监测。所提方法利用 LLM 的通用知识提升探索效率、适配可迁移到相似环境的选项,并通过语义标注提供内在可解释性。为验证框架有效性,我们在 Office World 和 Montezuma's Revenge 两个领域分别开展实验。结果表明其在数据效率、约束遵从和跨任务迁移性上表现更优。

LLM 辅助的语义选项发现以促进自适应深度强化学习
图2:LLM-SOARL框架