论文

VTAM:从视频预训练模型迁移视觉与触觉操作能力

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

模型训练监督微调与指令调优

摘要

视频动作模型(VAM)已成为一种有前途的具身智能框架,它可以从原始视频流中学习隐式世界动态,以产生时间一致的动作预测。尽管此类模型通过视觉推理在长视野任务中表现出强大的性能,但它们在接触丰富的场景中仍然受到限制,在这种场景中,仅通过视觉只能部分观察到关键的交互状态。特别是,细粒度的力调制和接触转换没有可靠地编码在视觉标记中,导致不稳定或不精确的行为。为了弥补这一差距,我们引入了视频触觉动作模型(VTAM),这是一种多模式世界建模框架,将触觉感知作为补充的物理感知依据。 VTAM 通过轻量级模态传输微调,用触觉流增强预训练视频 Transformer,从而实现高效的跨模态表示学习,而无需触觉语言配对数据或独立的触觉预训练。为了稳定多模态融合,我们引入了触觉正则化损失,以强制平衡的跨模态注意力,防止动作模型中的视觉潜在优势。 VTAM 在接触丰富的操作中表现出卓越的性能,平均保持 90% 的稳健成功率。在需要高保真力感知的薯片拾放等具有挑战性的场景中,VTAM 的性能比 pi 0.5 基线高出 80%。我们的研究结果表明,整合触觉反馈对于纠正世界动作模型中的视觉估计错误至关重要,为具有物理感知依据的具身基础模型提供了一种可扩展的方法。