论文
以环境信念更新引导具身Agent探索
Align While Search: Belief-Guided Exploratory Inference for World-Grounded Embodied Agents
摘要
在本文中,我们提出一种测试时自适应 Agent,它通过后验引导的信念精化执行探索性推理,而无需依赖基于梯度的更新或对部分可观测环境下运行的 LLM Agent 进行额外训练。我们的 Agent 对环境状态维护一个外部结构化信念,通过动作条件观测迭代地更新它,并通过在信念空间上最大化预测信息增益来选择动作。我们使用轻量级的基于 LLM 的代理模型估计信息增益,并通过一种新颖的奖励评估世界对齐,该奖励量化后验信念与真实环境配置之间的一致性。实验表明,我们的方法在以显著更低的集成开销对齐潜在世界状态方面,优于提示增强或检索增强 LLM 等推理时扩展基线。
