论文

腿:微调 用于在具体高斯飞溅世界中进行人形机器人操作的无 Teleop VLA

LEGS: Fine-Tuning Teleop-Free VLAs for Humanoid Loco-manipulation in an Embodied Gaussian Splatting World

模型训练合成数据

摘要

用于人形机器人操作的视觉-语言-动作(VLA)策略的训练受到收集人类远程操作演示的高成本和复杂性的限制。到目前为止,在模拟器中微调的 VLA 策略未能在人形机器人操作任务中有效地迁移。我们推出了 LEGS(通过 Embodied Gaussian Splatting 进行局部操纵),这是一种混合模拟器,可将网格前景(机器人、物体、道具)合成到从手持场景捕获重建的逼真 3D 高斯 Splatting (3DGS) 背景上。 LEGS 使用程序运动基元生成器来大规模合成标记演示,无需人工远程操作,并使用确定性两阶段颜色校准来将渲染的 3DGS 图像与机器人的部署相机对齐。在 Unitree G1 人形机器人上,在三个增加全身难度的拾放任务和三个 VLA 主干(psi_0、pi_0.5、GR00T N1.6)中,纯粹基于 LEGS 数据训练的策略在每个实验中都匹配或超过了基于人类远程操作演示训练的策略。它还优于纯网格模拟基线,该基线消除了 3DGS 背景的影响,表明照片级真实感渲染是合成数据传输的关键推动者。人形运动的记录与 LEGS 中的场景外观无关,允许在新的背景和对象网格下重新渲染相同的自动生成的演示(以比远程操作低 15 倍以上的成本覆盖新场景)来增强训练数据,以增强对场景变化的鲁棒性。在组合的对象和场景外观转变下,在重新渲染的 LEGS-AUG 数据上训练的策略保持任务成功,而在远程操作数据上训练的基线完全失败。我们的项目页面位于 https://legsvla.github.io/。