论文

TacZero:冻结视觉语言模型结合触觉实现插入操作

TacZero: Training-Free Peg Insertion Using a General-Purpose Vision-Language Model with Tactile Feedback

智能体系统Agent 环境交互

摘要

根据语言指令和感官观察自主确定其行为的机器人可以执行新的接触丰富的操作任务,而无需特定于任务的训练或手工设计的规则。为了执行这些任务,机器人必须推断物体如何相互接触并因此移动,然后选择动作。对于接触推理和动作选择,现有方法涉及设计估计模型和触觉反馈控制律,或用于对象运动估计、动作结果预测和触觉数据动作选择的学习模型。相反,我们提出 TacZero,它使用预训练的通用视觉语言模型 (VLM) 来解释视觉和触觉观察并选择机器人动作,而无需额外的触觉或操作训练或用于接触解释或动作选择的任务特定规则。 TacZero 为 VLM 提供相机图像、机器人状态和三轴触觉响应,以数值或叠加在图像上的矢量表示。根据这些观察结果和交互历史记录,VLM 生成指定目标末端执行器位置和夹具打开或关闭的命令,由低级控制器执行。在现实世界的圆柱钉插入实验中,TacZero 在使用数字触觉输入的 20 次试验中成功了 15 次,而在没有触觉输入的 20 次试验中,TacZero 成功了 10 次。这项研究为使用通用 VLM 进一步研究接触丰富的操纵提供了具体的起点,并强调了追求这一方向的挑战。

TacZero:冻结视觉语言模型结合触觉实现插入操作:论文原图
图 2:TacZero 概述。给定任务指令、视觉和触觉观察、机器人状态和交互历史,VLM 输出目标末端执行器位置、夹具打开或关闭命令以及包含简短观察和原因的注释。控制器执行命令,并将新的观测结果反馈给 VLM。