论文
StairVLA:阶段感知的分层动作生成
StairVLA: Stage-Aware Hierarchical Action Generation for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型越来越依赖基于扩散或流匹配的动作头来生成连续的机器人动作。这些动作头通常以基本一致的方式处理降噪轨迹。然而,我们观察到调节焦点自然地在去噪阶段转移:早期阶段结合语言指令和视觉观察来建立粗略的动作轨迹,而后期阶段则更加强调当前的视觉观察以进行动作对齐。基于这种见解,我们引入了StairVLA,这是一种阶段感知的分层动作生成框架,它使用部分去噪动作作为粗略长视野动作生成和局部细化之间的自然接口。高级 VLA 执行早期去噪,以产生可重复使用的长视野部分去噪动作轨迹,而轻量级细化器以更高的频率运行,以使用最新的观测结果细化局部 动作块。该设计可分摊昂贵的高级 VLA 计算,同时保留频繁的闭环校正。在 LIBERO 上,我们的 GR00T 式实例化将平均成功率从 96.5% 提高到 97.8%,同时将每个 动作块 的摊销推理延迟从 115.0 毫秒降低到 44.2 毫秒。更广泛地说,在两个 VLA 骨干模型、模拟基准测试和真实机器人任务中,StairVLA 持续降低推理成本,同时保持强大的任务性能。
