论文
CAAT:用接触感知注意力与触觉掩码提高接触操作的数据效率
CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation
摘要
在接触丰富的操作中,视觉观察主要引导自由空间中的运动,而触觉观察在接触过程中变得特别有用。然而,基于标准 Transformer 的视觉触觉策略通常依赖于词元串联或可学习门控。这些方法缺乏明确的接触感知先验,使得很难从演示中有效地学习有效的跨模式表示。为了解决这个限制,我们提出了 CAAT,一个轻量级的接触感知框架,它通过注意力缩放和动态触觉掩蔽明确地结合了接触先验。具体来说,CAAT强调接触前的视觉信息和接触过程中的触觉信息。它还通过将当前触觉观察与非接触参考进行比较来抑制静态背景标记。 CAAT 可以集成到常用的基于 Transformer 的策略中,而无需修改其操作解码器。在模拟中,将 CAAT 与 ACT 相结合,平均成功率比直接视觉触觉融合提高了 18.0 个百分点,比门控融合提高了 10.0 个百分点。在使用视觉触觉 UMI 平台的现实实验中,CAAT 在 ACT、Diffusion Policy 和 $π_0$ 上的平均成功率达到 60.0%,比最强基线平均高出 21.1 个百分点。这些结果表明,显式接触先验和动态触觉掩蔽可有效改善视觉触觉策略学习和不同策略架构的任务绩效。 https://mrjianjm.github.io/caat/