论文

迈向大语言模型智能体的信念世界模型

Towards a Belief-Based World Model for LLM Agents

智能体系统Agent 规划

摘要

大语言模型(LLM)正在许多领域用作自主决策和规划的政策。尽管LLM具有很强的推理能力,但他们在长期任务上遇到了困难,尤其是在部分可观察性的情况下。世界模型是在训练和推理过程中提高政策绩效的一种有前景的方法。在推理过程中,智能体目前使用世界模型在采取行动之前模拟候选行动的后果,这可以改善决策。然而,我们认为,对于部分可观察性下的决策来说,单独的模拟是一个不完整的接口:模拟并不能充分捕获当前状态的不确定性,而代理可能需要这些不确定性才能做出准确的决策。我们通过基于信念的世界模型 (BB-WM) 解决了这一限制,该模型建模并维持一种信念,即LLM可以查询以获取有关当前状态的已知和不确定信息。在开发学习准确的 BB-WM 的方法之前,我们首先问一个更基本的问题:将世界模型的信念直接暴露给 LLM 政策是否可以改善决策?我们的结果表明,让 LLM 代理访问世界模型信念可以提高部分可观察性下的任务性能,同时保持对现有基于模拟的世界模型的补充。代码发布于 https://github.com/skumar-ml/belief-world-models。

迈向大语言模型智能体的信念世界模型:论文配图
图1 认知行动的模拟与信仰。假设一辆汽车试图采取务实行动 换到左边的车道, 但盲点未知。在改变车道之前,以模拟为基础的世界模型可以对未来进行取样,以便改变车道是安全的(即盲点没有汽车)。然后,该政策可以执行这一行动,但只能在其盲点遇到汽车。政策通过基于信仰的世界模式,可以查询目前对盲点的信念,如果存在不确定性,可以在选择适当的务实行动之前采取适当的认知行动(例如检查盲点)。