论文
何时ASK:面向强化学习的不确定性门控语言辅助
When to ASK: Uncertainty-Gated Language Assistance for Reinforcement Learning
摘要
强化学习(RL)智能体常常难以应对分布外(OOD)场景,导致高不确定性和随机行为。尽管语言模型(LM)蕴含宝贵的世界知识,但更大的模型计算成本高昂,妨碍实时使用,且在自主规划方面存在局限。我们提出Adaptive Safety through Knowledge(ASK),将较小的LM与训练好的RL策略相结合,无需重新训练即可增强OOD泛化。ASK采用Monte Carlo Dropout评估不确定性,仅当不确定性超过设定阈值时才向LM查询动作建议。这种选择性使用既保留了现有策略的效率,又在不确定情形下借助语言模型的推理能力。在FrozenLake环境上的实验显示,ASK在域内没有提升,但在迁移任务中表现出稳健的导航能力,取得0.95的奖励。我们的结果表明,有效的神经符号集成需要精心编排而非简单组合,凸显了成功实现OOD泛化需要足够的模型规模和有效的混合机制。
