论文
VT-Bridge:通过轻量级残差适应将预训练的基础 VLA 桥接到 VTLA
VT-Bridge: Bridging Pretrained Foundation VLAs to VTLAs via Lightweight Residual Adaptation
摘要
视觉-触觉-语言-动作(VTLA)模型在接触丰富的操作中表现出明显优于视觉-语言-动作(VLA)模型的优势。然而,开发 VTLA 模型受到所需的大量视觉触觉数据和计算资源的严重限制。为了解决这个瓶颈,我们提出了 VT-Bridge,这是一种轻量级残差自适应策略,可将预训练的基础 VLA 与 VTLA 连接起来。 VT-Bridge 不是从头开始训练 VTLA 模型或修改预训练 VLA 的原始架构,而是在 VLA 主干上采用相同的轻量级剩余适配器架构,并使用主干特定的权重来细化机器人执行频率的动作。这种设计大大降低了数据和训练的障碍。具体来说,每个任务需要多达 50 次视觉触觉演示来微调 VLA 主干并训练 0.98M 参数的残余适配器。在四个接触丰富的操作任务中使用三个代表性 VLA 主干($\pi_0$、$\pi_{0.5}$ 和 SmolVLA)进行的实验进一步证明了其在 VLA 架构中的一致有效性。平均而言,仅通过任务级 VLA 微调,VT-Bridge 将任务完成率从 11.7% 提高到 62.9%。总之,这些发现证明了 VT-Bridge 对于接触丰富的操作具有广泛的适用性、有效性和可访问性。项目页面可通过此 https URL 获取。