论文

用于接触丰富的机器人操作的表征对齐触觉与动作表征对齐

Representation-Aligned Tactile Grounding for Contact-Rich Robotic Manipulation

模型训练监督微调与指令调优

摘要

触觉增强视觉语言动作(VLA)策略已被引入用于接触丰富的操作,其中关键的交互状态通常隐藏在视觉之外。未来的触觉预测是一种很有前途的使用触摸的方式,因为它将触觉结果转化为对动作引起的接触动态的监督。然而,VLA 策略包含具有不同角色的表示,从感知编码到运动预测,使得这种监督应该应用在哪里并不清楚。我们将其作为表示对齐问题来研究。通过线性探针分析,我们发现未来的触觉状态最容易从中间动作专家特征中预测,而不是从视觉语言特征或最终动作状态中预测。受这一观察的启发,我们引入了一种轻量级的潜在触觉预测器(LTP),它可以根据已识别的中间表示来预测紧凑的未来触觉嵌入。通过避免直接预测嘈杂的原始触觉信号,LTP 提供了一个动作与接触结果对应的监督信号,使中间动作表示与未来的接触后果保持一致。对现实世界中接触丰富的操作任务的实验表明,在中间动作表征上对齐触觉监督优于较少对齐或多界面的触觉预测,这凸显了应用触觉监督的重要性。