论文
STARRY:以时空动作为中心的机器人操作世界建模
STARRY: Spatial-Temporal Action-Centric World Modeling for Robotic Manipulation
摘要
机器人操作需要对未来时空交互和几何约束进行推理,但现有的视觉-语言-动作(VLA)策略往往使预测表示与动作执行弱耦合,导致需要精确时空协调的任务失败。我们提出了 STARRY,一种世界模型增强的动作生成策略,通过统一的扩散过程对未来时空潜伏和动作进行联合去噪,从而使时空预测和动作生成保持一致。为了连接 2D 视觉标记和 3D 度量控制,STARRY 引入了几何感知选择性注意调制 (GASAM),它将预测的深度和末端执行器几何形状转换为标记对齐的权重,以进行选择性动作注意调制。在 RoboTwin 2.0 上,STARRY 在 50 项双手任务的清洁和随机设置下取得了 93.82% / 93.30% 的平均成功率。现实世界的实验表明,与 $π_{0.5}$ 相比,STARRY 将平均成功率从 42.5% 提高到 70.8%。这些结果证明了以动作为中心的时空世界建模对于空间和时间要求较高的机器人操作的有效性。