论文

ForeTac-VLA:预测未来触觉状态以指导机器人操作

ForeTac-VLA: A Forecasting-Based Tactile-Vision-Language-Action Model for Contact-Rich Robotic Manipulation

智能体系统Agent 环境交互

摘要

视觉-语言-动作(VLA)模型在机器人操作方面表现出了强大的能力,但它们对视觉感知的依赖限制了在接触丰富的环境中的鲁棒性,在这些环境中,关键的物理交互状态可能无法通过视觉观察到。现有的触觉增强 VLA 方法使用观察到的触觉反馈来改善对物理环境的理解与对齐,但大多数方法仍然很大程度上是反应性的,而不是明确地模拟接触如何演变。因此,我们提出了 ForeTac-VLA,一种基于预测的触觉-视觉-语言融合模型,可以预测未来的触觉状态以指导动作生成。具体来说,ForeTac-VLA 将最近的触觉观察编码为时间表示,并通过双向交叉注意将它们与视觉语言特征集成。此外,基于Transformer的预测模块可以预测多步的未来触觉状态,使模型能够对观察到的和预期的接触进行联合推理。最后,融合的多模态表示和预测的未来触觉状态被输入到 VLA 主干以调节动作的生成。为了稳定训练,当早期预测不可靠时,会采用地面实况预测课程。在现实世界的四项接触丰富的操作任务中,ForeTac-VLA 的平均成功率为 95%,比微调的 VLA 模型高出 36.25 个百分点,比最先进的触觉增强 VLA 基线高出超过 22 个百分点。 ForeTac-VLA 在低照度和视觉混乱的条件下也能保持强大的性能。视频演示可以在此 https URL 上找到