论文
Agent-BRACE:通过语言化的状态不确定性将信念与长期任务中的行动解耦
Agent-BRACE: Decoupling Beliefs from Actions in Long-Horizon Tasks via Verbalized State Uncertainty
摘要
大语言模型 (LLM) 越来越多地部署在部分可观察环境中的长期任务上,它们必须在通过多个步骤推断和跟踪复杂环境状态的同时采取行动。这导致了两个挑战:部分可观察性需要保持未观察到的世界属性的不确定性,而较长的交互历史会导致上下文无限制地增长,从而稀释与任务相关的信息。解决这两个挑战的原则性解决方案是信念状态:给定过去的观察和行动的环境状态的后验分布,无论情节长度如何,它都会紧凑地编码决策历史。然而,在 LLM 代理中,文本的开放式性质使得如何表示这种分布变得不清楚。因此,我们引入了 Agent-BRACE:通过抽象和置信度估计进行代理信念状态表示,该方法将 LLM 代理解耦为信念状态模型和策略模型,并通过强化学习联合优化。信念状态模型产生信念分布的结构化近似:一组关于环境的原子自然语言声明,每个声明都用从确定到未知的序数语言确定性标签进行注释。政策模型以这种紧凑的、结构化的近似信念为条件,而不是完整的历史,学习在明确的不确定性下选择行动。在长视野、部分可观察的体现语言环境中,Agent-BRACE 实现了 +14.5% (Qwen2.5-3B-Instruct) 和 +5.3% (Qwen3-4B-Instruct) 的平均绝对改进,超越了强大的 RL 基线,同时保持了独立于情节长度的近乎恒定的上下文窗口。进一步的分析表明,随着证据的积累,习得的信念在事件的过程中变得越来越校准。