论文
更快且真正被执行器使用的 VLA 路点规划
Fast Plans, Faithful Actions: Closing the Planning-Execution Gap in Hierarchical Vision-Language-Action Models
摘要
分层视觉语言动作(VLA)系统由高级视觉语言规划器和生成连续动作的低级动作专家组成。只有当规划器能够足够快地生成计划以满足实时控制要求,并且生成的计划实际上有助于行动的生成时,这种分层设计才具有实用价值。我们研究了一个这样的系统,一个改编自 $π_{0.5}$ 的路点层次结构管道,发现这两个要求都没有得到满足。该基线依赖于词元级自回归解码 (Token-AR) 来生成路点计划,需要 57 次非常昂贵的视觉语言模型 (VLM) 前向传递。然而,我们发现删除路径点端点对任务成功影响不大。两个发现揭示了规划器与执行器的不一致:规划器以过细的粒度生成输出,而执行器未充分利用计划作为控制条件。我们通过路点对齐块自回归解码(Block-AR)解决延迟问题,并通过归一化目标调制(NGM)规划未充分使用的问题,这是一种受相位选通和反捷径训练约束的分层目标路径,使路点在保留其他信号的同时影响动作生成。我们的方法将 LIBERO 上的 VLM 前向传递的最大数量从 57 次减少到 8 次,包括一个前缀预填充,并在 Rokae 双臂机器人上实现了 8.7倍 的规划延迟减少。通过标准化目标调节和反捷径训练,Block-AR 在 LIBERO-Long 上的成功率从 91.0% 提高到 96.2%,而四个套件的平均成功率从 95.85% 提高到 98.45%。使用该机器人执行三项双手任务时,不同方法的成功率仍然相当。
