论文

OmniTacTune:与策略无关的现实世界强化学习,用于视觉策略的触觉残差适应

OmniTacTune: Policy-Agnostic Real-World RL for Tactile Residual Adaptation of Visual Policies

模型训练强化学习

摘要

从人类视频、远程操作和机器人演示中学到的视觉策略提供了可扩展的运动先验,但在接触丰富的操作中常常失败,其中成功很大程度上取决于局部力和接触几何形状。触觉传感提供了这些补充信号,但触觉数据的收集成本仍然很高,而且很难在传感器、机器人和任务之间进行推广。我们引入了 OmniTacTune,这是一种与策略无关的现实世界 RL 管道,它通过残差校正使触觉反馈适应预训练的视觉策略。 OmniTacTune 采用两阶段设计:首先从自主基本策略执行轨迹中引导触觉感知学习,然后通过在线交互学习轻量级触觉残留策略。大量实验表明,OmniTacTune 可以泛化各种接触丰富的任务、视觉基础策略和触觉表征。在四个现实世界中接触丰富的任务中,它在 40-80 分钟内将视觉基础策略的成功率从 5-40% 提高到 85-100%,展示了一种将触觉反馈适应可扩展视觉机器人策略的有效路径。项目页面:https://colinyu1.github.io/omnitactune-site/