论文

WOLF-VLA:视觉-语言-动作学习的全身人形最佳运动框架

WOLF-VLA: Whole-Body Humanoid Optimal Locomotion Framework for Vision-Language-Action Learning

摘要

视觉-语言-动作(VLA)模型最近在机器人操作方面表现出了强大的泛化能力,但由于数据稀缺、缺乏动态一致的演示以及在基于学习的管道中编码最优性和安全性的困难,它们对全身、接触丰富的人形运动的适用性仍然严重不足。这项工作引入了一个统一的框架 WOLF-VLA,它将全身最优控制(OC)运动合成与大规模多模态数据集相结合,以训练能够直接从自然语言指令生成人形运动策略的 VLA。我们构建了一个涵盖六个与运动相关的任务系列的动态可行人形轨迹的综合数据集,每个任务系列都通过环境变化、物体颜色、位置和视觉干扰因素进行参数化。我们使用收集的联合轨迹、以自我为中心的视觉观察和自然语言指令来训练 VLA 模型,产生一种策略,该策略对初始条件可变性表现出强大的推理能力和鲁棒性,并在多个任务和环境设置中表现出竞争性的表现。系统的消融研究证明了每种模式对模型性能的影响。完整的数据集、模型检查点和基准测试模拟套件将公开发布,为全身人形运动丰富的 VLA 控制建立可重复的动态一致基准,并支持指令驱动运动策略的可扩展传输的未来研究。