论文

世界模型的清醒梦:学会怀疑想象力并通过信任做出决定

Lucid Dreaming for World Models: Learning to Doubt Imagination and Decide by Trust

模型评测鲁棒性、公平性与可信度评测

摘要

世界模型使智能体能够在想象中学习和计划,但超出其经验的预测可能会变得不可靠并误导决策。从预测中得出的现有不确定性估计可能对不熟悉的状态-动作对仍然过于自信。我们提出了清醒世界模型(LucidWM),它从经验中学习怀疑,并通过想象传播信任。通过将主观逻辑整合到分类潜在转变中,LucidWM 将预测结果与其证据支持区分开来,并为每个转变分配一定程度的怀疑。这种疑问的补充定义了过渡级信任,它沿着想象的轨迹乘法积累,以重新衡量政策学习的回报并指导行动选择。不确定性估计不需要额外的参数或前向传递。 LucidWM 根据 17 个不确定性读数对四个基本世界模型进行评估,在行动损坏的rollout过程中检测环境变化并发出不确定性信号。在受控导航案例研究中,基于信任采取行动将实现目标所需的步骤从 362 步减少到 190 步。十五个演示视频展示了 LucidWM 如何怀疑其梦想并根据这种怀疑采取行动。视频可在 https://lucidwm.github.io. 获取