论文
VisForce:目标条件灵巧操作的当前和所需力的视觉基础
VisForce: Visual Grounding of Current and Desired Forces for Goal-Conditioned Dexterous Manipulation
摘要
视觉-语言-动作(VLA)模型已成为通用机器人操作策略。然而,在灵巧的手部操作中,接触力通常作为单独的状态或特定于力的表示来提供,使得难以明确地表示力与其相应的视觉位置之间的空间对应关系。在这项工作中,我们提出了 VisForce,它可以在视觉上将当前和所需的力放置在相应的指尖位置。 VisForce 在当前手腕图像和特定于任务的目标图像上呈现当前和所需的视觉力提示,并通过目标条件交叉注意力将两种表示结合起来,以生成力感知动作。我们使用配备 RH56F1 灵巧手的真实 UR10 机器人,通过力调节抓取和三个多阶段操作任务来评估 VisForce。在力调节抓取实验中,随着所需力的增加,VisForce 表现出一致的抓取力响应,并且对鸡蛋和牙膏管的抓取和举起成功率分别为 70% 和 80%。它还在杯子插入/瓶子倾倒、钳子辅助面包转移和滑动调节钉孔中分别实现了 70%、55% 和 40% 的最终成功率。这些结果表明,指尖对齐的视觉力表示可以有效地用于基于 VLA 的灵巧手操作中的力感知调节。