论文

τ:从未来视觉监督中学习触摸增强视觉语言动作模型

τ: Learning Touch-Augmented Vision-Language-Action Models from Future Visual Supervision

摘要

将触觉传感纳入视觉-语言-动作 (VLA) 模型有望实现丰富的接触操作,而仅凭视觉观察往往无法捕获有关物理交互的关键线索。然而,在特定任务数据有限的情况下,学习信息丰富的触觉表示,同时有效地使其适应预训练的 VLA 模型仍然具有挑战性。现有方法要么关注瞬时接触状态,要么使用 6D 扳手序列对时间交互动力学进行建模,而对高维触觉信号的探索还不够。为了应对这些挑战,我们提出了 τ,一种触摸增强的 VLA 框架,受联合嵌入预测架构 (JEPA) 的启发,它从未来的视觉监督中学习动作条件的时空触觉表示,并将其与视觉语言特征融合以生成动作。这种监督在潜在空间中运行,仅在训练期间使用,不会增加部署开销。我们还介绍了 TacAura,这是一个跨四个代表性的富含接触的操作任务的同步视觉、本体感觉和基于视觉的触觉信号的数据集。实验表明,τ 优于现有模型,并可推广到未见过的物体和场景,从而提高了操作性能和鲁棒性。项目页面:https://cocacola-lab.github.io/tau-Page/。