论文

ST-$π$:用于机器人操作的结构化时空 VLA

ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation

摘要

视觉-语言-动作(VLA)模型在一般机器人任务上取得了巨大成功,但在细粒度时空操作方面仍然面临挑战。通常,现有方法主要将时空知识嵌入到视觉和动作表示中,并直接执行跨模态映射以进行步骤级动作预测。然而,这种时空推理在很大程度上仍然是隐式的,使得处理具有明确时空边界的多个连续行为变得困难。在这项工作中,我们提出了 ST-$π$,一种用于机器人操作的结构化时空 VLA 模型。我们的模型以两个关键设计为指导:1)时空 VLM。我们将 4D 观察结果和任务指令编码到潜在空间中,并将它们输入到 LLM 中,以生成一系列按因果顺序排列的块级动作提示,其中包括子任务、空间基础和时间基础。 2)时空行动专家。以块级动作提示为条件,我们设计了一种结构化的双生成器指导来联合建模空间依赖性和时间因果关系,从而预测步骤级动作参数。在这个结构化框架内,VLM明确规划全局时空行为,行动专家进一步细化局部时空控制。此外,我们还为 微调 提出了一个具有结构化时空注释的真实机器人数据集。已经进行了大量的实验来证明我们模型的有效性。我们的代码链接:https://github.com/chuanhaoma/ST-pi。