论文

何时ASK:面向强化学习的不确定性门控语言辅助

When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning

智能体系统Agent 架构与控制循环

摘要

强化学习(RL)智能体常常难以应对分布外(OOD)场景,导致高不确定性和随机行为。尽管语言模型(LM)蕴含宝贵的世界知识,但更大的模型计算成本高昂,妨碍实时使用,且在自主规划方面存在局限。我们提出Adaptive Safety through Knowledge(ASK),将较小的LM与训练好的RL策略相结合,无需重新训练即可增强OOD泛化。ASK采用Monte Carlo Dropout评估不确定性,仅当不确定性超过设定阈值时才向LM查询动作建议。这种选择性使用既保留了现有策略的效率,又在不确定情形下借助语言模型的推理能力。在FrozenLake环境上的实验显示,ASK在域内没有提升,但在迁移任务中表现出稳健的导航能力,取得0.95的奖励。我们的结果表明,有效的神经符号集成需要精心编排而非简单组合,凸显了成功实现OOD泛化需要足够的模型规模和有效的混合机制。

何时ASK:面向强化学习的不确定性门控语言辅助:论文配图
FrozenLake ×88\!\times\!8(a) 状态(b) 模式FrozenLake ×44\!\times\!4(c) 状态(d) 模式Fig.图 2:FrozenLake-v11 环境的示意图和图像表示。在图中。在图2(d)和2(b)中,每个单元对应于马尔可夫状态,并且特殊图块表示开始(S)、目标(G)和最终失败状态(H)。这些结构化状态描述被编码为上下文信息并纳入提示中,通过门控干预支持 PPO 政策中的决策。