论文

AT-VLA:自适应触觉注射,用于增强视觉-语言-动作模型中的反馈反应

AT-VLA: Adaptive Tactile Injection for Enhanced Feedback Reaction in Vision-Language-Action Models

摘要

视觉-语言-动作(VLA)模型显着提高了机器人代理执行各种任务的能力;然而,它们在需要精确物理交互的接触丰富的操作场景中仍然面临挑战。为了解决这一限制,最近的研究尝试在下游任务中纳入触觉信号,使预先训练的 VLA 能够解释触觉反馈。然而,在微调过程中引入新的模式(这些模式很少出现在预训练阶段)可能会破坏 VLA 的预训练能力。此外,VLA 固有的缓慢推理速度阻碍了实时响应,并限制了触觉反馈用于动作调整的有效利用。为了克服这些挑战,我们提出了自适应触觉视觉-语言-动作(AT-VLA),它引入了一种新颖的自适应触觉注入机制。该机制动态地确定触觉注入的适当时机和位置,仅在其对动作生成有显着贡献时才合并,从而最大限度地减少对预训练表示的干扰。此外,为了实现快速准确的触觉响应,我们提出了一种触觉反应双流机制,将感觉处理解耦为用于低频感知推理的慢速视觉语言流和用于高频物理交互理解的快速触觉控制流,从而在0.04秒内实现实时闭环响应。现实世界的实验彻底验证了 AT-VLA 在接触丰富的操作任务中的有效性。该项目页面位于:https://sites.google.com/view/at-vla。