论文
DeCAL:通过接触感知的潜在共同想象实现基于物理的灵巧视觉-语言-动作模型
DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
摘要
灵巧的操作涉及与物理世界的丰富接触和细粒度交互,由于严重的视觉遮挡和复杂的接触动力学,对现有的视觉-语言-动作(VLA)模型提出了重大挑战。虽然最近的工作已将触觉传感纳入机器人操作中,但大多数方法仍然依赖于同质多模态融合,缺乏自适应触觉集成和物理动力学的显式建模。在这项工作中,我们提出了 DeCAL,一种基于物理的灵巧视觉-语言-动作模型,它统一了理解、想象力和动作生成,以实现接触丰富的灵巧操作。 DeCAL 建立在 Transformer (MoT) 混合架构之上,利用专业专家来实现每种功能,同时实现它们之间的高效信息流。为了有效地利用触觉信息,我们引入了自适应视觉-触觉融合,它通过接触感知门控策略动态调节触觉交互。此外,我们提出了视觉-触觉潜在共同想象来联合建模视觉和触觉动力学,为策略配备隐含的物理世界知识。实验结果表明,DeCAL 在所有任务中始终保持最先进的性能,达到 71% 的平均成功率和 83.4% 的进度成功率,同时还表现出对未见过的场景的强大泛化能力。该网站位于 https://aureleopku.github.io/DeCAL。