论文

Belief-State Engine:支持部分可观测环境规划的信念状态引擎

Belief-State Engine: Augmenting LLMs for Principled Planning Under Partial Observability

智能体系统Agent 规划

摘要

大型语言模型智能体可以在各种任务中产生流畅的动作序列,但一旦环境变得部分可观察,它们就会以特有的方式失败。模棱两可的反馈会让他们做出过早的承诺。一次信息丰富的观察可能会将他们的不确定性推向错误的假设。随着历史的发展,政策也会发生变化。我们将这些症状追溯到一个常见的结构原因。通常部署的 LLM 智能体是一种历史条件策略,对隐藏状态没有明确的信念。我们提出了一个架构修复方案。信念状态引擎 (BSE) 是放置在大语言模型之外的推理模块。它在给定 POMDP(部分可观察马尔可夫决策过程)模型的潜在状态上维护贝叶斯后验,并且在每个决策步骤中仅向 LLM 公开该后验。未显示原始操作观察日志。我们提出了信念一致的内部状态必须满足的最小四公理规范,并证明与 BSE 配对的 LLM 是关于由底层 POMDP 引发的信念 MDP 的健全马尔可夫策略。因此,它继承了经典 POMDP 理论的贝尔曼最优性保证,前提是大语言模型从未接触过原始历史。我们根据六个基线评估 Tiger POMDP 和红队攻击图任务的架构:反应式 LLM、思想链、ReAct、自然语言信念跟踪器、QMDP 和 POMCP。在这两个领域中,BSE 增强智能体都提高了任务回报、信念校准和决策一致性。十个有针对性的消融隔离了每种架构选择的贡献,证实了效果并不特定于任何一种模型。本文附有代码、环境规范、提示模板和种子日志。