论文
LAMP:将图像编辑提升为开放世界操作的通用 3D 先决条件
LAMP: Lift Image-Editing as General 3D Priors for Open-world Manipulation
摘要
开放世界中的类人泛化仍然是机器人操作的基本挑战。现有的基于学习的方法,包括强化学习、模仿学习和视觉语言动作模型(VLA),常常难以应对新任务和看不见的环境。另一个有前途的方向是探索可概括的表示,捕获细粒度的空间和几何关系以进行开放世界的操作。虽然大语言模型 (LLM) 和视觉语言模型 (VLM) 提供基于语言或带注释的 2D 表示的强大语义推理,但它们有限的 3D 感知限制了它们对细粒度操作的适用性。为了解决这个问题,我们提出了 LAMP,它将图像编辑提升为 3D 先验,将对象间 3D 变换提取为连续的、几何感知的表示。我们的主要见解是,图像编辑本质上编码丰富的 2D 空间线索,并将这些隐式线索提升为 3D 转换,为开放世界操作提供细粒度和准确的指导。大量实验表明,\codename 可提供精确的 3D 变换,并在开放世界操作中实现强大的零样本泛化。项目页面:https://zju3dv.github.io/LAMP/。