论文

使用语言模型先验从观察中学习 POMDP 世界模型

Learning POMDP World Models from Observations with Language-Model Priors

智能体系统Agent 环境交互

摘要

无论是在建筑物中导航、操作机器人还是玩游戏,在环境中有效行动的智能体必须首先学习该环境如何运作的内部模型。部分可观察马尔可夫决策过程 (POMDP) 为此类内部世界模型提供了灵活的建模类,但仅从观察-动作轨迹中学习它们具有挑战性,并且通常需要广泛的环境交互。我们询问语言模型先验是否可以通过利用先验知识来减少代价高昂的交互,并引入 \emph{Pinductor} (POMDP-inductor):LLM 从一些观察-动作轨迹中提出候选 POMDP 模型,并迭代地细化它们以优化基于信念的似然得分。尽管使用严格较少的信息,\emph{Pinductor} 仍与基于 LLM 的 POMDP 学习方法(假设对隐藏状态的特权访问)的性能和样本效率相匹配,同时显着超过了表格 POMDP 基线的样本效率。进一步的结果表明,性能随着 LLM 功能的扩展而扩展,并且随着有关环境的语义信息被保留而适度降低。总之,这些结果将语言模型先验定位为部分可观察性下样本高效世界模型学习的实用工具,并朝着现实世界环境中的通才代理迈出了一步。代码可在 https://github.com/atomresearch/pinductor 获取。