论文
微调 VLA 具有用于多任务操作的自我演示生成控制
Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation
摘要
最先进的视觉语言动作 (VLA) 模型(例如 $π_{0.5}$)表现出强大的语义理解、指令遵循和任务行为。然而,当部署在新机器人上时,即使硬件配置相对于预训练的微小不匹配也会导致性能严重下降。对来自新机器人形态的域内专家数据的VLA进行微调提高了专家任务的性能,但导致其原始指令跟随和行为先验的损失。在本文中,我们提出了一种自监督方法,该方法从零样本 VLA 生成在线交互展示,作为微调的附加训练数据。我们的实验表明,这种微调方案产生了强大的多任务策略,在目标机器人上,(1)继承从零样本模型中提取的先前任务,(2)实现通用指令跟踪,同时(3)从专家数据中学习新技能,提高样本效率。我们展示了我们的方法在真实 ALOHA 机器人上的测试集探测泛化和 RoboTwin 中的新模拟基准上的成功。视频结果可在 https://self-supervised-control.pages.dev/ 获取