论文

ViTaR:用于基础 VLA 操作的视觉触觉残差适应

ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation

智能体系统Agent 环境交互

摘要

随着视觉-语言-动作(VLA)模型向现实世界部署扩展,丰富的接触操作暴露了一个关键盲点:这些策略编码了广泛的视觉语义先验,但仍然不知道本地接触事件,无论接触建立、失去还是不稳定,都会产生相同的动作。现有的补救措施要么修改 VLA 内部结构,冒着灾难性遗忘的风险,要么要求在接近失效的接触条件下进行在线加固。两者都对动作生成产生无限的触觉影响,与使 VLA 具有普遍性的先验相冲突。我们引入了 ViTaR,它将触觉反馈从动作生成感知输入重新构建到执行调制器,该执行调制器在冻结的 VLA 上选择和缩放有界残差校正,通过构建保留预训练的功能。 ViTaR 将适应分解为两个阶段:效果引导建模通过基于结果的偏好证据来确定是否以及哪种校正是局部合理的,而残余动作调节将这些证据转换为残余选择,并从实时视觉触觉观察中获得连续缩放的增益。在涵盖七项接触丰富任务的 UniVTAC 基准上,ViTaR 取得了 61.3% 的平均成功率,比其冻结的 VLA 基础提高了 30.6 个百分点,也超过了专门构建的触觉基线。物理机器人实验证实,有界触觉调制会转移到真实的传感器噪声和动态。