论文

TacCoRL:通过仿真将触觉反馈集成到 VLA 中

TacCoRL: Integrating Tactile Feedback into VLA via Simulation

模型训练强化学习

摘要

视觉-语言-动作(VLA)模型为机器人操作提供了强大的视觉、语言和动作先验,但仅靠视觉观察往往会错过接触丰富的任务所需的局部接触状态。我们提出了 TacCoRL,这是一个可扩展的框架,它将触觉反馈注入 VLA 策略中,并通过模拟-真实协同训练和基于模拟的强化学习 (RL) 对其进行改进,而不需要大规模的触觉预训练或广泛的现实世界接触探索。关键思想不仅是添加触摸作为输入,而且是学习接触读数如何调节接近失败状态下的动作响应,这种状态在演示中很少见,并且在硬件上收集有风险。我们使用真实对齐的模拟器作为接触交互的闭环训练环境。混合模拟和真实轨迹首先在预训练策略中热启动触觉条件动作。具有可验证任务奖励的强化学习然后使用模拟接触推广来优化策略。它强化了导致任务完成的触觉条件动作,而真实轨迹上的监督目标使细化策略保持锚定于部署视觉、触觉和动作分布。由此产生的策略直接传输到真实机器人,无需特权模拟状态或在线现实世界强化学习。在四项双手接触丰富的任务中,最终的视觉触觉策略的平均成功率为 72.5%,而基线为 50.0%。结果视频和更多详细信息请访问 https://tac-corl.github.io/