论文
神经符号体现代理
Neurosymbolic Embodied Agents
摘要
语言和视觉语言模型生成看似合理的具体计划,但不能保证可执行性,因为它们的输出可能违反环境动态或作用于错误视觉定位的实体。我们提出了一种神经符号代理,它将长期的家务任务纳入任务导向的视觉探索和受限的符号规划中。在第一阶段,视觉语言模型和探索工具从以自我为中心的观察和扎根的交互中获取与目标相关的谓词和实例绑定,从而产生符号初始状态。在第二种情况下,PDDL 转换模型将解码限制为扩展适用操作的词元。然后,蒙特卡罗树搜索使用与域无关的规划启发式来评估可执行的延续。由此产生的计划可以通过在过渡模型下构建来执行,并以正确的视觉基础为条件转移到环境中。在 VirtualHome 和 ALFWorld 上,开放 4B-27B 模型在这两种环境中的成功率都超过 90%,并且我们最小的代理在每种环境中都大大优于 27B 直接视觉策略。事实证明,约束和搜索是互补的,而不是可以互换的:在 ALFWorld 中,单独使用它们可以解决三分之一以下的任务,而它们的组合可以解决超过 95% 的任务。该方法还使用比扩展思维少几倍的生成标记,比直接交互少得多的模型可见图像,并且残余故障定位于状态获取而不是没有任何专门训练的计划生成。