论文
$N_0$-VTLA:使用潜在触觉词元扩展视觉-触觉-语言-动作模型
$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens
摘要
我们提出$N_0$-VTLA,一种视觉-触觉-语言-动作(VTLA)基础模型,能够(1)通过触觉感知和触觉反馈控制进行细粒度的丰富接触操作,以及(2)根据存储的部署数据改进离线策略。基于当前基于视觉的骨干网,我们提出了触觉集成的训练方案,包括视觉-触觉 预训练、分阶段触觉路径集成和优势条件离线策略改进。在 预训练 期间,该策略从我们的大型视觉触觉机器人数据集 NeoData 中学习广泛的接触先验;据我们所知,$N_0$-VTLA 是第一个针对大规模触觉数据进行预训练的 VTLA 模型。在 后训练 期间,我们通过预测触觉路径来增强策略,该路径将大规模学习的接触模式提炼为下游以触觉为中心的操作所需的精细运动调整。对于离线策略改进,我们引入了 ALTER,这是一种优势条件离线强化学习方法,可将相对进度和轨迹事件比较转换为二元优势标签,用于固定部署语料库上的策略训练,进一步改进针对丰富接触技能(例如可变形对象操作)的特定任务学习。在接触丰富的基准测试中,$N_0$-VTLA 的表现大幅优于强基线:它赢得了所有九个真实机器人 NeoReal 任务,并在 20 个任务模拟套件上达到 63.8% 的平均成功率,而最强基线的平均成功率为 44.0%。使用 ALTER 训练的 $N_0$-VTLA 策略在三项长期真实机器人任务中取得了 75-95% 的成功。这些结果为多功能触觉驱动的操纵策略奠定了基础。