论文
TAP-VLA:视觉语言动作模型的触觉注释提示
TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models
摘要
视觉-语言-动作 (VLA) 模型通过利用大规模视觉和语言 预训练,展示了对视觉、语义和空间任务变化的令人印象深刻的推理。然而,他们在很大程度上仍然对接触力视而不见,接触力很少在视觉反馈中清楚地体现出来,但却是富含接触的操纵的核心。触觉传感直接测量这些力,但将其集成到 VLA 中很困难:用于预训练 VLA 的大规模语料库中缺少触觉数据,因此将其添加为新的输入模态会引起分布变化,从而侵蚀使 VLA 有效的 预训练。我们提出了视觉-语言-动作模型的触觉注释提示(TAP-VLA),这是一个简单的框架,通过视觉增强而不是架构改变来提供触觉反馈。 TAP-VLA 从视觉触觉传感器中提取剪切场,并将它们作为空间定位向量叠加到策略已经消耗的多视图 RGB 图像上,从而在 VLA 的本地观察空间中产生清晰、可解释的触觉提示。由于架构未受影响,因此该方法不需要触觉 预训练,增加的计算量可以忽略不计,并且保持接近 预训练 分布。在四项接触丰富的任务中,TAP-VLA 在 78% 的试验中取得了成功,而仅视觉 微调 和替代触觉融合基线的成功率低于 50%——包括基线表现不比机会更好的任务。