论文
SoftVTBench:变形感知视觉触觉数据集和可变形对象操作的基准
SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation
摘要
物理交互质量是可变形物体操作的核心,但大多数基准测试仅评估任务成功与否。策略可能会在允许滑动或导致过度压缩的同时完成任务。主要瓶颈是缺乏将策略可见接触观察与独立物理 真值 在完整任务上配对的视觉触觉数据集。我们引入了 SoftVTBench,这是一个用于物理交互感知可变形对象操作的视觉触觉数据集。它包含 4,000 个专家演示和 50 多个资产,包括体积可变形对象和视觉匹配的刚性双胞胎。在 20 Hz 频率下,每一集同步多视图 RGB、双指触觉 RGB 和标记运动、本体感觉、语言以及二进制和连续的抓手动作,以及仅限评估器的有限元 (FEM) 状态。在此数据集的基础上,我们建立了一个闭环基准,该基准使用固定的特定于对象的校准来定义变形感知成功率(DSR),只有当完成任务并将峰值归一化变形保持在公差范围内时,才会将执行轨迹视为成功。在扩散策略、$π_{0.5}$ 和 FastWAM 中,所有 12 个分布内配置都包含违反变形容差的成功执行轨迹,占每种配置成功的 0.7--24%。在分配转移下,视觉触觉变体在所有六种策略套件比较中实现了更高的任务成功率,在五种策略套件比较中实现了更高的 DSR,而它们的分配内收益是好坏参半的。这些结果表明,提供触摸功能本身并不能确保有效的多模式融合。因此,SoftVTBench 提供了一个通用的视觉触觉资源,不仅可以用于研究策略是否成功,还可以研究它如何与可变形对象进行物理交互,以及触摸何时可以改善这种交互。