论文
LaMP:以 3D 场景流作为潜在运动先验学习视觉-语言-动作策略
LaMP: Learning Vision-Language-Action Policy with 3D Scene Flow as Latent Motion Prior
摘要
我们引入了 \textbf{LaMP},一个双专家视觉-语言-动作框架,它将密集的 3D 场景流嵌入为机器人操作之前的潜在运动。现有的 VLA 模型直接从 2D 语义视觉特征回归动作,迫使它们隐式学习复杂的 3D 物理交互。这种隐式学习策略在不熟悉的空间动力学下会退化。LaMP 通过将流匹配 \emph{Motion Expert} 与通过门控交叉注意力来实现策略预测 \emph{Action Expert}。具体来说,Motion Expert 会生成单步部分去噪的 3D 场景流,其隐藏状态会影响 Action Expert,而无需进行完整的多步重建。我们在 LIBERO、LIBERO-Plus 和 SimplerEnv-WidowX 模拟基准以及真实实验上评估 LaMP。LaMP 始终优于 LIBERO、LIBERO 中评估的 VLA 基线, LIBERO-Plus 和 SimplerEnv-WidowX 基准,在相同的训练预算下实现了报告的最高平均成功率。在 LIBERO-Plus OOD 扰动上,LaMP 显示出更高的鲁棒性,与最强的先前基线相比平均增益为 9.7%。我们的项目页面位于 https://summerwxk.github.io/lamp-project-page/。