论文
迈向大语言模型智能体的信念世界模型
Towards a Belief-Based World Model for LLM Agents
摘要
大语言模型(LLM)正在许多领域用作自主决策和规划的政策。尽管LLM具有很强的推理能力,但他们在长期任务上遇到了困难,尤其是在部分可观察性的情况下。世界模型是在训练和推理过程中提高政策绩效的一种有前景的方法。在推理过程中,智能体目前使用世界模型在采取行动之前模拟候选行动的后果,这可以改善决策。然而,我们认为,对于部分可观察性下的决策来说,单独的模拟是一个不完整的接口:模拟并不能充分捕获当前状态的不确定性,而代理可能需要这些不确定性才能做出准确的决策。我们通过基于信念的世界模型 (BB-WM) 解决了这一限制,该模型建模并维持一种信念,即LLM可以查询以获取有关当前状态的已知和不确定信息。在开发学习准确的 BB-WM 的方法之前,我们首先问一个更基本的问题:将世界模型的信念直接暴露给 LLM 政策是否可以改善决策?我们的结果表明,让 LLM 代理访问世界模型信念可以提高部分可观察性下的任务性能,同时保持对现有基于模拟的世界模型的补充。代码发布于 https://github.com/skumar-ml/belief-world-models。
