论文

RCT:机器人收集的用于触觉泛化的触摸视觉语言数据集

RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization

模型评测基准与评测资源

摘要

对于操纵开放世界物体的机器人,触觉表征必须推广到看不见的材料。我们介绍了 RCT(机器人接触触觉),这是一个机器人收集的触摸视觉语言数据集,其中包含 7 个类别的 122 种工业参考材料上的完整机器人压力机的 29,279 个触觉帧,并使用三个数字传感器在多个接触位置进行记录。 RCT 将每次按压保留为接触序列,从而能够跨材料、类别、传感器、接触位置和接触序列进行保留评估。一次按下的帧具有很强的相关性:帧随机分割可以在训练和测试中对相同的物理交互进行近乎重复的观察。在编码器固定的情况下,消除接触序列重叠可将触觉到文本的 Recall@1 降低 17.7 个百分点。当在训练时额外保留材料时,性能急剧下降,使得保留材料 Recall@1 在 3 次保留抽签中平均为 25.1 +/- 6.1%。公开的 TVL/HCT 分割显示了相同的结构:每个测试接触序列都出现在训练中,并且原始像素最近邻在 98.3% 的情况下恢复了正确的序列。对新闻机进行均匀采样可以改善对比训练,而经过 RCT 训练的嵌入可以改善对未见材料的类别探测。 RCT 使接触序列感知、保留材料评估可重复,并将新材料泛化作为机器人触觉感知的核心挑战。 RCT 数据集开源于 https://faerber-lab.github.io/RCT/