论文

TouchScale:500小时人类视觉与触觉学习数据

TouchScale: 500 Hours of Human Vision and Touch for Visual-Tactile Learning

模型训练应用与实践监督微调与指令调优合成数据机器人

摘要

大规模以自我为中心的人类交互数据正在成为体现学习的身体监督的重要来源,但仅视频就没有记录作为身体交互特征的接触和压力。最近的视觉触觉数据集提供了这种缺失的监督,但它们的同步触觉数据的数量仍然比人类视频小得多。此外,最大的资源通常会合并来自不同传感器或注释程序的记录,这使得数据规模的影响难以隔离。因此,我们引入了 TouchScale,这是一个使用单一统一可穿戴设备记录的 500 小时丰富接触人类交互数据集。其大约 2K 的预定义任务描述涵盖日常活动和结构化操作,每个记录都将自我中心的 RGB-D 视频与手腕 RGB 视频和密集的双手触觉测量暂时对齐。与之前的触觉数据相比,在完整的 TouchScale 上进行训练将来自看不见的触觉传感器的数据的零样本接触 IoU 从 0.134 提高到 0.383。预训练视觉编码器 在所比较的视觉触觉数据集中,TouchScale 在三个基准测试中也产生了最高的动作识别准确度。 TouchScale 用于机器人策略的视觉-触觉中期训练,将四项接触丰富的操作任务的平均现实世界成功率从 22.5% 提高到 57.5%。在传感器和收集协议保持不变的情况下,随着使用更多 TouchScale 数据,零样本触觉预测和机器人成功率都呈现整体上升趋势。这些结果表明,大规模收集的具有一致感知的人类视觉触觉数据有利于感知和机器人操作。我们将公开发布 TouchScale,包括所有同步的视觉触觉记录和重建的对象模型,以支持未来可扩展视觉触觉学习的研究。

TouchScale:500小时人类视觉与触觉学习数据:论文原图
图 1:概述。 TouchScale 是通过统一的可穿戴系统收集的大规模人类视觉触觉数据集。捕捉:通过同步头部 RGB-D、双手手腕 RGB 以及双手触觉测量来记录人类交互。数据集:TouchScale 包含 500 小时的数据、大约 87K 个剧集以及大约 2K 涵盖各种日常交互的任务描述。评估:我们在触觉预测、动作识别和机器人操作方面对其进行评估。