论文

DIAL:通过端到端 VLA 的潜在世界建模将意图和行动解耦

DIAL: Decoupling Intent and Action via Latent World Modeling for End-to-End VLA

摘要

预训练的视觉语言模型 (VLM) 显着加速了视觉语言动作 (VLA) 模型的开发。然而,大多数现有的端到端 VLA 主要将 VLM 视为多模式编码器,直接将视觉语言特征映射到底层操作。这种范式没有充分利用 VLM 在高级决策中的潜力,并引入训练不稳定,经常降低其丰富的语义表示。为了解决这些限制,我们引入了 DIAL,这是一个通过可微的潜在意图瓶颈桥接高级决策和底层运动执行的框架。具体来说,基于 VLM 的 System-2 通过在 VLM 的本机特征空间内合成潜在视觉预见来执行潜在世界建模;这种远见明确地编码了意图并成为结构瓶颈。然后,轻量级的 System-1 策略通过潜在的逆动力学将这一预测意图与当前观察结果一起解码为精确的机器人动作。为了确保优化稳定性,我们采用两阶段训练范例:解耦预热阶段,其中系统 2 学习预测潜在的未来,而系统 1 在统一特征空间内的 真值 未来指导下学习电机控制,然后进行无缝的端到端联合优化。这使得动作感知梯度能够以受控方式细化 VLM 主干,保留预先训练的知识。 RoboCasa GR1 Tabletop 基准测试的大量实验表明,DIAL 建立了一种新的最先进技术,与之前的方法相比,演示次数减少了 10 倍,从而实现了卓越的性能。此外,通过利用异构人类演示,DIAL 学习物理基础的操作先验,并在人形机器人的实际部署过程中对看不见的物体和新颖的配置表现出强大的零样本泛化能力。