论文

CLUE:通过闭环探索消除机器人任务的上下文不确定性

Actively Resolving Contextual Uncertainty for Underspecified Tasks in Natural Language

智能体系统Agent 规划Agent 环境交互

摘要

基础模型为机器人提供了解释自然语言和推理环境背景的能力,但大多数以语言为条件的策略都假设目标是明确指定的,并且任务相关信息是通过先前的地图预先提供的。在不熟悉的环境中执行描述不充分的任务会带来很高的上下文不确定性:机器人必须共同推断什么构成任务成功,什么构成相关信息,以及该信息存在于何处(或是否存在)。我们通过 CLUE(闭环上下文不确定性解决方案)解决这些限制,这是一个主动解决自然语言中描述不充分的任务的上下文不确定性的框架。 CLUE 使用大语言模型衍生的策略来假设与任务相关的概念和潜在计划。然后,它使用在线构建的嵌入语言的地图,将这些假设转化为行动。该策略通过闭环环境交互顺序评估假设,并在收集新信息时完善其计划。我们在 Boston Dynamics Spot 的三个真实室内和室外环境中部署 CLUE,涉及 15 项需要对象消歧、功能推理和遮挡推理的任务。 CLUE 的成功率与理想参考策略相差不超过 7 个百分点,约为没有闭环反馈的 LLM 规划器的 4 倍。支持实验表明,简单地构建然后查询语言丰富的地图不足以解决复杂的上下文规划任务;这些方法的成功率约为 CLUE 的三分之一,同时需要超过 10 倍的 VLM token。我们在 https://zacravichandran.github.io/CLUE 提供更多信息。

CLUE通过假设定位和主动信息收集,在闭环中消除任务上下文的不确定性。
图2(图注摘要):CLUE通过假设定位和主动信息收集,在闭环中消除任务上下文的不确定性。