论文

Tac2Pix:用于灵巧操作的图像空间视觉触觉融合

Tac2Pix: Image-Space Visuo-Tactile Fusion for Dexterous Manipulation

摘要

视觉和触觉对于灵巧的操作来说是天然的互补。然而,它们以根本不同的形式表示:视觉观察是密集的、空间结构化的,而触觉测量是稀疏的、异构的且以机器人为中心的。这种不匹配使得在两种模态之间建立明确的空间对应变得具有挑战性,特别是当它们在潜在空间中融合时。然而,每个触觉测量都与机器人运动链上的已知位置相关联,提供了可以弥补这种表征差距的先验定位。这就提出了一个自然的问题:这种本地化先验可以用来构建一个共享的表示,明确地将触摸与视觉对齐吗?我们引入了 Tac2Pix,这是一种图像空间视觉触觉融合框架,它使用正向运动学和相机校准将稀疏触觉测量结果投影到 RGB 图像平面上,然后将它们渲染为力感知显着图。通过在与视觉相同的像素空间中表达触摸,Tac2Pix 直接利用预先训练的 2D 视觉表示。我们进一步采用零初始化输入适应来保留策略学习开始时的原始视觉路径。为了评估这种基于几何的界面是否能产生一致的策略收益,我们在三个模拟和三个现实世界的灵巧操作任务上评估了 Tac2Pix。在模拟中,Tac2Pix 持续改进跨任务、策略架构和视觉主干的视觉触觉策略学习。在现实世界的实验中,与最强的潜在视觉触觉融合基线相比,它在视觉遮挡下的平均成功率提高了 26.7 个百分点,并且在随机遮挡和物理遮挡下都保持了增益。总之,这些结果支持图像空间作为将稀疏触摸与预先训练的视觉表示融合的有效接口。