论文

Vela:通过自适应动作曲线参数化扩展视觉-语言-动作模型

Vela: Scaling Vision-Language-Action Models with Adaptive Action Curve Parametrization

摘要

大多数视觉语言动作模型将未来运动表示为固定速率动作块,将时间分辨率和预测范围与固定输出预算联系起来。这种逐点表示浪费了高度相关的相邻动作的容量,留下了隐式学习的时间连续性和平滑性,并迫使在长视野覆盖和接触丰富的操作所需的局部精度之间进行权衡。为了解决这些限制,我们引入了 Vela,一种视觉-语言-动作基础模型,它将未来的机器人行为表示为连续轨迹。 Vela 将紧凑的基于样条的动作表示与运动相关的时间支持和异构实施例的共享动作接口相结合,允许固定的输出预算适应其跨运动的时间分辨率。我们在大规模多实施例机器人数据上对 Vela 进行预训练,并在 LIBERO-X、EBench 和两个现实世界的长期任务(鸡蛋饼烹饪和土豆切丝)上对其进行评估,在模拟和物理操作方面获得了有希望的结果。这些结果凸显了连续动作表示作为未来具体化基础模型的基础的潜力。项目页面和更多结果:https://clementine24.github.io/Vela/ 。

Vela:通过自适应动作曲线参数化扩展视觉-语言-动作模型的原论文方法或结果图
图 1:Vela 概述。在推理时,Vela 联合预测一组固定的样条控制点和一个与运动相关的地平线,定义可以以任意控制速率采样的连续动作轨迹。在训练期间,运动相关的水平自适应构建了充分代表所演示运动的监督目标。因此,相同的控制点预算涵盖了平滑运动的较长跨度和需要更精细时间分辨率时的较短跨度。