论文

ASK in the Dark:部分可观测性下的不确定性门控 LLM 协助

ASK in the Dark: Uncertainty-Gated LLM Assistance under Partial Observability

上下文与知识上下文工程

摘要

在部分可观察性下运行的强化学习代理必须对不完整的信息采取行动,这使它们成为具有广泛推理先验的小语言模型(SLM)指导的自然候选者。然而,将 SLM 指南集成到这种设置中已被证明是困难的:在所有测试环境中,普通的不确定性门控方法实现的覆盖率为零或接近零,这意味着 SLM 几乎从不贡献独立的操作。我们将这种失败追溯到纯粹的以自我为中心的提示,它为真正的推理提供了不足的背景,并将其识别为背景问题而不是能力问题。我们提出 ASK+,它为 SLM 提供轨迹感知上下文(部分显示的地图、访问过的位置和行动历史)和结构化思想链推理,将其从被动冗余检查转变为信息更丰富的顾问,偶尔会纠正策略。我们进一步确定,用于选择性查询的预测熵信号测量的是动作不确定性而不是状态不确定性,并且在 POMDP 中仍然提供信息,使得不确定性门控援助在完全可观察的设置之外可行。状态提示带来了显着的收益:在 DoorKey 上,普通 ASK 与 PPO 相匹配(均为 89%),ASK+ 的成功率达到 93%;在 FourRooms 上,成功率从 53% 攀升至 70%;在 HigherLower 上,准确率达到 73.7%,与仅 SLM 的上限相匹配。在所有环境中,Qwen3.5-2B 匹配或超过 Qwen3.5-4B,证实即时设计和选择性门控主导模型规模的影响,从而无需大型模型即可进行指导。