论文
用于在视觉-语言-动作模型中集成物理反馈的模块化感觉流
Modular Sensory Stream for Integrating Physical Feedback in Vision-Language-Action Models
摘要
人类通过视觉感知之外的各种物理反馈来理解现实世界并与之互动。受此推动,最近的方法尝试将物理感觉信号纳入视觉-语言-动作模型(VLA)中。然而,它们通常关注单一类型的物理信号,未能捕捉现实世界交互的异构性和互补性。在本文中,我们提出了 MoSS,一种模块化的感觉流框架,它采用 VLA 来利用多个感觉信号进行动作预测。具体来说,我们引入了解耦模态流,通过联合跨模态自注意力将异构物理信号集成到动作流中。为了能够稳定地融入新模式,我们采用了两阶段训练方案,在早期阶段冻结预训练的 VLA 参数。此外,为了更好地捕获接触交互动态,我们结合了一项预测未来物理信号的辅助任务。通过广泛的现实世界实验,我们证明 MoSS 成功增强了 VLA,以利用不同的物理信号(即触觉、力和扭矩),集成多个信号以实现协同性能增益。