论文
通过语义 3D 高斯泼溅实现开放词汇移动操作的具体多模态基础
Embodied Multimodal Grounding for Open-Vocabulary Mobile Manipulation via Semantic 3D Gaussian Splatting
摘要
体现的移动操作需要在执行之前协调语言、视觉观察、三维场景结构和动作可行性。我们研究了当地家庭工作空间中具有少样本操作的开放词汇目标定位,并提出了一种具体化的多模态定位框架,该框架集成了主动多视图语义 3D高斯泼溅 (Semantic-3DGS)、可达性感知基础定位和基于扩散的视觉语言动作策略。任务驱动的本地 Semantic-3DGS 充当主动感知、语言条件 3D 定位、障碍感知场景推理、基础准备和动作模型语义条件的共享接口。为了保留预先训练的动作先验,3D 语义提示仅注入到后期动作专家块中。在针对代表性视觉语言动作 (VLA) 方法的扩展 50 次试验真实机器人评估中,整个系统实现了 60% 的长视野成功率,而 PointVLA 为 40%,DexVLA 为 28%;在严重混乱的操作中达到 74% 的成功率,而单视图变体为 52%,PointVLA 为 46%。它还在 75 厘米高度偏移下保持 75% 的成功率,并消除了光引起的错误抓取。这些结果表明,明确的、可刷新的 3D 语义基础可以提高在杂乱、遮挡、视点变化和实施例约束下的鲁棒性。