论文

部分可观察性下语言引导对象检索的选择性承诺

Selective Commitment for Language-Guided Object Retrieval under Partial Observability

智能体系统Agent 架构与控制循环

摘要

部分可观察性下的语言引导对象检索需要决定是收集更多证据、与场景交互、抓住候选者还是放弃。我们提出了一个闭环框架,用于协调这些决策,以检索与参考容器相关的指定目标。该框架通过跟踪对象、未观察到的目标和目标不存在的假设,对目标身份、容器关系和存在保持持久的联合信念。视图条件分类 VLM 观察更新了这一信念;保形抓取资格和机器人可行性控制承诺,而有限视野信念空间规划选择信息收集行动。在五种不同的场景中,我们提出的方法在 19/25 次模拟中取得了成功,而性能最佳的任务适应基线则为 12/25,并且是唯一在每种场景中至少取得一次成功的评估策略。消融表明,跨视图记忆提高了部分遮挡下的成功率,而完整系统的性能并不总是优于简化的变体。真实的机器人试验证明了闭环重新观察和从注入的抓取失败中自主恢复,而注入的视点失败则以错误延迟结束。实验结果证明了在部分可观察性下的统一检索框架内协调证据收集和选择性掌握承诺的可行性。