论文

RoBoSR:用于具体机器人推理的结构化场景表示

RoBoSR: Structured Scene Representations for Embodied Robotic Reasoning

智能体系统Agent 规划

摘要

尽管取得了快速进展,但现实世界可变性下的具身推理仍然具有挑战性。现有方法依赖于演示驱动的顺序偏差,限制了开放式和长期任务的灵活性,这些任务需要对不断发展的状态进行结构化推理。我们引入了 RoBoSR,一种中间结构表示,它将操作表述为基于语义、以对象为中心的场景图上的逐步状态转换。通过在感知-动作界面上对对象状态及其空间关系进行建模,RoBoSR 将高级任务推理与原始输入分开,并实现对先决条件、效果和目标状态的结构化推理。这种表示赋予智能体因果推理能力,强制执行子任务依赖性并支持连贯的长期任务规划。为了学习这种结构感知推理,我们构建了 Manip-Cognition-1.6M,这是一个开放世界的数据集,可以共同监督跨不同任务的场景理解、指令解释和子任务规划。在多个基准测试和现实世界的演示中,我们的方法在零样本泛化和长视野任务中始终优于基于提示的方法和经典 TAMP 基线。结果强调结构化中间表示是可扩展的具体推理的关键归纳偏差。