论文

Deform360:用于可变形世界模型的海量多视图视觉触觉数据集

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

模型评测基准与评测资源

摘要

预测物体动力学(即世界建模)是机器人操纵的一项基本挑战,而对可变形物体进行建模由于其高维状态空间和复杂的材料属性而呈现出特别困难的情况。当前的世界模型通过两种不同的范式来解决这个问题:学习 2D 像素空间或更明确的 3D 几何空间的动态。由于缺乏多样化、大规模的现实世界数据,对它们的相对优势和局限性的系统理解仍然难以实现。为了解决这个问题,我们推出了 Deform360,这是一个大型视觉触觉数据集,包含 198 个日常生活物体、1,980 个交互序列以及来自 41 个环视摄像头和双手触觉抓手的超过 215 小时的观察,以捕获全局运动和接触引起的局部变形。利用新型无标记视觉触觉 3D 跟踪管道来提取密集的几何形状和运动,我们系统地评估当前最先进的世界模型,将 2D 视频模型与 3D 粒子模型进行比较。最后,我们通过在可变形物体上执行机器人规划任务来提供初步演示,表明我们的数据集在现实世界中的适用性。我们的分析揭示了对结构先验和可扩展性之间权衡的关键见解,为未来以可变形对象为中心的世界建模的研究提供了坚实的基准。项目网站:https://deform360.lhy.xyz