论文

STAR:用于灵巧操作的视觉-触觉-语言-动作模型中的稀疏触觉表征学习

STAR: Sparse Tactile Representation Learning in Vision-Tactile-Language-Action Models for Dexterous Manipulation

模型训练预训练

摘要

灵巧的操作需要协调的多指控制和有效的触觉反馈,但由于缺乏大规模的现实世界数据以及从稀疏的触觉信号中提取有效表示的困难,学习这些能力仍然具有挑战性。我们构建了一个机器人平台和远程操作系统,以收集 200 小时的双手灵巧操作数据集,并具有同步的视觉、触觉和语言注释,包括 65 个任务的 10,576 个轨迹,其中 69.5% 涉及灵巧多指操作。我们进一步提出了 STAR,一种视觉-触觉-语言-动作(VTLA)模型的集成训练方法,通过视觉-触觉联合预训练、稀疏全局触觉标记表示和稀疏未来触觉预测来解决触觉信号的空间、时间和信息稀疏性。在此数据集上进行训练后,STAR 在四个现实任务中实现了 61% 的平均成功率,每个任务有 100 个训练后轨迹,展示了特定任务训练后的灵巧性能。