论文

用于零样本机器人任务推理和执行的类脑分层框架

A Brain-inspired Hierarchical Framework for Zero-Shot Robot Task Reasoning and Execution

智能体系统Agent 架构与控制循环

摘要

遵循开放式语言指令的机器人需要将语义意图与视觉场景理解、几何可行性、对象状态和物理交互条件联系起来。端到端视觉-语言-动作策略改进了跨任务泛化,但它们通常将视觉和语言输入直接映射到机器人动作,为长视野分解、物理验证和恢复留下了有限的显式结构。我们提出了“方法”,这是一种零镜头分层框架,其功能受到人脑角色划分的启发,包括视觉感知和状态推理、语言基础和来自共享原子动作库的动作序列生成、基于成本的计划选择以及真实的机器人执行和验证。该框架将命令置于显式对象状态中,将可重用的原子操作组合成任务条件序列,按执行成本对替代序列进行排名,并根据刷新的观察结果验证中间物理结果。在评估中,\method{} 在平坦和不规则的初始布局条件下完成了 10/10 干净板试验、10/10 拾放试验和 4/5 金字塔堆叠试验;相应的平均任务进度分别为 $99.03\%$、$100.00\%$ 和 $96.67\%$。在所有评估条件下,\method{} 的成功率高于 ReKep、Dream2Flow 和 $π_{0.5}$ 基准,证明了将显式对象状态推理、组合原子操作、基于成本的计划选择和闭环执行验证相结合的有效性。