论文

TacSushi:基于触觉的世界动作建模,用于灵巧的寿司操作

TacSushi: Tactile-Grounded World-Action Modeling for Dexterous Sushi Manipulation

模型训练监督微调与指令调优

摘要

灵巧的食物操控需要在变形、咬合和不确定接触下进行控制。我们提出了 TacSushi,一种基于触觉、基于 Cosmos3 的世界行动政策,它可以从记录的未来后果中学习,同时根据当前的观察采取行动。主干网对当前 RGB、语言和手部状态进行编码,并且特征门控融合将指尖触觉特征合并到动作表示中。在训练期间,解码器以演示的动作块为条件,预测记录的未来视觉观察、任务进度、相对接触风险和触觉摘要;该解码器在部署时被删除。失败的试验提供了后果监督,但他们的行为被排除在模仿之外。我们在 340 次成功和 50 次失败的真实机器人试验中对 TacSushi 进行了训练,并在 600 次单独部署中比较了三种分配内任务和两种分配外成分变体的六种方法。为了评估超出单一几何阈值的食品质量,我们使用锚定视觉质量协议对最终结果进行评分,该协议对每次执行轨迹的五个人类评分和三个视觉语言模型评分进行同等权重。 Full TacSushi 的平均分布内成功率为 68.3%,分布外成功率为 37.5%,而没有未来后果监督的情况为 36.7%/10.0%,使用直接触觉串联代替门控融合的情况为 25.0%/17.5%。这些比较支持特征门控触觉融合和仅训练预测监督的互补优势。