论文
将视觉与语言定位到3D掩码以实现长程箱子重排
Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement
摘要
我们研究在仅使用视觉观测的条件下,依据欠指定的自然语言目标在3D环境中进行长程规划的问题,聚焦多步3D箱子重排任务。现有方法要么依赖对状态与目标的关系定位脆弱的符号规划器,要么依赖2D视觉语言模型(VLM)直接生成动作序列。两种方法都难以应对多物体推理、丰富的3D几何与隐式语义约束。3D VLM的最新进展展示了将自然语言指称对象强定位到3D分割掩码的能力,预示着更通用规划能力的潜力。我们扩展现有3D定位模型,提出Reactive Action Mask Planner(RAMP-3D),将长程规划形式化为对成对3D掩码的顺序反应式预测:一个“取哪个物体”掩码指示抓取什么,一个“放到哪个目标区域”掩码指定放置位置。所得到的系统处理RGB-D观测与自然语言任务说明,以反应式方式生成用于3D箱子重排的多步抓放动作。我们在包含1-30个箱子和多样化自然语言约束的仓库式环境中,跨11个任务变体开展实验。RAMP-3D在长程重排任务上取得79.5%的成功率,显著优于基于2D VLM的基线,确立了基于掩码的反应式策略作为符号管线在长程规划上的有前景替代方案。
