论文
SCULPT-VLA:通过分阶段行动基础学习结构化控制
SCULPT-VLA: Learning Structured Control through Staged Action Grounding
摘要
视觉-语言-行动(VLA)政策越来越多地将结构化中间监督纳入行动标签之外。然而,指定中间表示应该编码什么,却让动作预测如何学习依赖它留下了悬念。我们引入 \textbf{SCULPT-VLA},这是一种通过分阶段行动基础学习结构化控制的策略。其动作调节状态包括任务进展、场景动态和空间基础的补充因素。训练首先用教师支架形成这些因素,然后当支架输入被撤回时,通过它们的组合来进行粗略的动作预测。随后恢复直接感知访问以进行持续细化,将学习到的状态与感知细节相结合。该课程将学习根据结构调节行动与完善持续控制分开。部署既不需要教师,也不需要离散动作自回归。 SCULPT-VLA 在 LIBERO、SimplerEnv-WidowX 和 RoboTwin 2.0 Full 上比共享主干基线取得了更高的平均成功率。在 SimplerEnv-WidowX 上,最终成功率为 83.5%,而 Stage-II 动作学习直接访问视觉和语言时的成功率为 71.3%。在四项物理机器人任务中,测试分布变化下的平均成功率达到 58.1\%,而 $\pi_{0.5}$ 的平均成功率为 45.6\%。训练消融和因素干预支持分阶段设计,并表明在恢复直接感知访问后,学习状态继续有助于控制。