论文
CodeGraphVLP:代码即规划器满足非马尔可夫视觉语言动作模型的语义图状态
CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型有望实现通用的机器人操作,但通常作为短期策略进行训练和部署,假设最新的观察结果足以进行动作推理。这种假设在非马尔可夫长视野任务中被打破,其中与任务相关的证据可能被遮挡或仅出现在轨迹的较早位置,并且杂乱和干扰因素使细粒度的视觉基础变得脆弱。我们提出了 CodeGraphVLP,这是一个分层框架,通过将持久语义图状态与基于可执行代码的规划器和进度引导的视觉语言提示相结合,实现可靠的长范围操作。语义图在部分可观察性下维护与任务相关的实体和关系。综合规划器在此语义图上执行以执行有效的进度检查并输出子任务指令以及子任务相关对象。我们使用这些输出来构建杂乱抑制的观察结果,使 VLA 执行器专注于关键证据。在现实世界的非马尔可夫任务中,CodeGraphVLP 比强大的 VLA 基线和支持历史的变体提高了任务完成率,同时与 VLM 循环规划相比,显着降低了规划延迟。我们还进行了广泛的消融研究,以确认每个组件的贡献。