论文

OpenViTac:统一仿真与真实场景的视觉触觉策略评测

OpenViTac: Learning and Benchmarking Visuo-Tactile Policies in a Unified Sim-and-Real Framework

模型评测模型训练应用与实践参数高效训练基准与评测资源机器人

摘要

触觉反馈为实体Agent提供了视觉观察之外的物理信息,从而实现与现实世界更可靠的交互。然而,尽管视觉-触觉-语言-动作(VTLA)策略取得了快速进展,但仍然缺乏评估模拟和现实世界中触觉机器人操作的统一基准。为了解决这一差距,我们引入了 OpenViTac,这是一种视觉触觉操纵基准,用于评估模拟和现实世界中的机器人策略。 OpenViTac 将丰富的接触操作组织为四个与触觉相关的功能维度,并提供配对的模拟现实世界设置,以实现 VLA、WAM 和 VTLA 策略的一致评估。在此基准的基础上,我们研究了不同的触觉表示和集成策略如何影响预训练 VLA 模型的性能。相应地,我们引入了 OpenVTLA,这是一种结合了性能最佳的表示和集成策略的触觉增强框架。此外,我们利用配对基准设置来研究 sim-real协同训练并分析影响跨域策略学习的因素。 OpenViTac 共同提供了一个用于评估和推进视觉触觉机器人操作的统一平台。

OpenViTac:统一仿真与真实场景的视觉触觉策略评测:论文原图
图 1:OpenViTac 概述。 OpenViTac 为视觉触觉操作建立了统一的基准,涵盖四个互补的能力维度:物理属性感知、脆弱性感知交互、丰富接触操作和精确操作。它提供与任务对应的模拟和具有对齐资产的现实世界设置,支持多个夹具配置和触觉传感器,并能够对两个领域的视觉触觉策略进行一致的评估。