论文

HT-Bench:基准测试和学习具有自我中心视觉的灵巧的全手触觉表征

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

模型评测基准与评测资源

摘要

由于触觉传感器设计、数据格式和机器人实施例的多样性,为机器人操作中的触觉表示学习建立通用基准仍然具有挑战性。我们不是寻求建立这样的目标,而是探索一个可扩展且有前途的未来发展方向:以自我为中心的视觉与全手触觉数据相结合。为此,我们引入了 \textbf{HT-Bench},这是一个用于灵巧的全手触觉感知的大规模多任务基准,包括在 226 个任务中收集的 1000 万个 RGB 帧和 780 万个触觉帧。 HT-Bench 从三个关键角度评估触觉表征:它们是否编码有意义的接触几何形状,它们是否可以将触觉观察与视觉信息对齐,以及它们是否泛化到看不见的任务。为了评估这些功能,HT-Bench 包括四项任务:细粒度触觉相似性检索、屏蔽触觉修复、视觉到触觉合成和多模式触觉帧预测。我们进一步提出了 \textbf{HandTouch},一种矢量量化的视觉-触觉编码器,它通过渐进的空间、跨模态和时间训练来学习触觉表示。在 HT-Bench 中,HandTouch 始终优于代表性触觉编码器基线,将细粒度触觉相似性检索的 Recall@5 从 74.65% 提高到 85.23%,将蒙版触觉修复的 RMSE 从 0.022 降低到 0.010,并将视觉到触觉合成的 OOD cIoU 从 0.628 提高到0.705。这些结果证明了 HandTouch 的有效性,并表明大规模以自我为中心的全手触觉数据为评估和推进灵巧操作中的触觉表征学习提供了可扩展的基础。