论文
SimpleTouch:无需额外触觉策略预训练的VLA扩展
SimpleTouch: Can Vision-Language-Action Models Master Contact-Rich Manipulation Without Tactile Policy Pretraining?
摘要
触觉感知为机器人操作提供关键接触信息,但将其纳入预训练视觉语言动作(VLA)模型仍有挑战。一个常见顾虑是,只在任务微调中加入触觉可能无法弥合跨模态缺口,收益有限甚至降低成功率。因此,现有方法往往依赖大规模触觉策略预训练或单独视触觉对齐,增加数据需求和训练阶段。我们提出SimpleTouch,以触觉专家扩展π₀.₅,检验这些额外阶段是否必要。专家使用冻结预训练触觉编码器的全部token,通过动作监督和未来触觉潜变量的多时间跨度预测学习。单阶段训练仅使用任务演示,无需额外触觉策略预训练或单独对齐。每项任务使用50次演示时,SimpleTouch在全部六项UniVTAC任务上取得被评估方法中的最高成功率。平均成功率为77.5%,对比FTP-π₀.₅的45.2%和FTP-1的66.7%,分别提高32.3和10.8个百分点。在四项真实任务上,平均成功率为71.3%,比FTP-1高8.8个百分点。这表明,在已有预训练VLA和触觉表示的条件下,额外触觉策略预训练并非这些任务获得强性能的先决条件,为接触丰富操作提供更简单路径。项目页:https://simpletouch-robot.github.io/