论文
VioLA:利用人类数据学习通用人形机器人控制
VioLA: Learning Generalist Humanoid Control Policies from Human Data
摘要
让人形机器人按指令协调全身动作有两个障碍。其动作空间庞大且紧密耦合:腿、手臂和手指必须在维持平衡的同时协同运动,使关节级动作难以学习。人形机器人演示也很稀缺,当前通用策略不能直接遵循新指令,部署前需在各任务的遥操作演示上微调。人类演示数量更多,但人的运动不是机器人指令。我们通过改变通用策略的预测对象来消除两个障碍。VioLA预测身体与手部运动的潜表示,而非关节指令;预训练身体和手部控制器在机器人上执行这些潜表示。相应运动编码器将人与机器人的运动映射到相同潜空间,因此人类录像可以在策略动作空间内标注。训练演示池包含1.406亿帧,93.2%来自人类。VioLA无需任务专属微调,即可在真实机器人上零样本遵循移动指令,成功率达100%,而GR00T N1.7和Ψ₀分别为16.7%与0%;未作任务专属微调的操作成功率为88.6%。同一方法适用于两个VLA和一个世界动作模型骨干。仅在人类演示上训练的通用策略也能在真实机器人上零样本执行移动任务。代码和检查点将发布。