论文

以环境信念更新引导具身Agent探索

Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents

智能体系统Agent 规划

摘要

在本文中,我们提出一种测试时自适应 Agent,它通过后验引导的信念精化执行探索性推理,而无需依赖基于梯度的更新或对部分可观测环境下运行的 LLM Agent 进行额外训练。我们的 Agent 对环境状态维护一个外部结构化信念,通过动作条件观测迭代地更新它,并通过在信念空间上最大化预测信息增益来选择动作。我们使用轻量级的基于 LLM 的代理模型估计信息增益,并通过一种新颖的奖励评估世界对齐,该奖励量化后验信念与真实环境配置之间的一致性。实验表明,我们的方法在以显著更低的集成开销对齐潜在世界状态方面,优于提示增强或检索增强 LLM 等推理时扩展基线。

以环境信念更新引导具身Agent探索 配图
图 4:Align While Search 框架。给定当前轨迹,AWS 通过“更新→投影”将语言映射为数值信念:观测更新全局文本信念 B^𝒢,随后将其投影为类别型动作后验 b^𝒮(a)(式 (4))。候选动作在模拟观测 ô 下按期望信息增益(IG)(式 (3))评分,排名最高的动作被返回给基础智能体。