论文

Premover:在指令完成之前采取行动,实现快速视觉-语言-动作控制

Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete

模型推理推理加速

摘要

视觉-语言-动作(VLA)策略通常被评估为用户在机器人开始行动之前完成了打字或说话。然而,在实际部署中,用户需要花费几秒钟的时间来输入请求,从而使策略在大部分交互过程中处于空闲状态。我们引入了 Premover,这是一个轻量级模块,可以将这个空闲窗口转换为有用的预计算。 Premover 保持 VLA 主干冻结,并连接两个小投影头,一个用于图像补丁,一个用于语言标记,将主干的中间层映射到共享空间。生成的焦点图由模拟器渲染的目标对象分割掩模进行监督,并用作下一步图像标记的每个补丁的重新加权。通过流前缀联合训练的单个标量就绪阈值决定策略何时开始起作用。在 LIBERO 基准套件上,Premover 将平均挂钟时间从 34.0 秒减少到 29.4 秒,减少了 13.6%,同时匹配完整提示基线的成功率(95.1% 与 95.0%);相比之下,天真的预移动则下降至 66.4%。