论文

TempoVLA:学习速度可控的视觉-语言-动作策略

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

模型训练合成数据

摘要

机器人操纵在要求快速执行的低风险运输阶段和要求缓慢、精确运动的高风险接触阶段之间交替。然而,现有的视觉-语言-动作模型(VLA)仅继承了训练演示中的单一固定速度。之前通过模型压缩、KV 缓存重用或强化学习来加速 VLA 的努力只是将策略从一种固定速度转变为另一种固定速度,而减速几乎未被探索。我们观察到,每个预测动作的大小已经决定了机器人移动的速度,为可控执行速度开辟了一条直接途径。我们将此观察结果转化为 TempoVLA,这是一个执行速度由显式条件控制的单个 VLA。 TempoVLA 结合了两个耦合组件。 (1) 数据侧变速轨迹增强 (VSTA),通过合并或拆分动作来重新计时演示到任何目标速度,同时保留其运动语义。 (2) 为政策提供速度的模型侧调节机制。统计数据显示,VSTA 达到了要求的速度,且运动误差可以忽略不计。模拟和现实任务中的实验表明,TempoVLA 可以实现两个方向的灵活速度控制,而 VSTA 通过更好的数据利用率还进一步提高了默认的 1 倍性能。此外,通过与大型多模态模型配合,TempoVLA实现动态速度控制,在低风险阶段加速,在高风险阶段减速。