论文
XEmbodied:具有增强的几何和物理线索的基础模型,适用于大规模具体环境
XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments
摘要
视觉-语言-动作 (VLA) 模型驱动下一代自主系统,但训练它们需要来自复杂环境的可扩展、高质量注释。当前的云管道依赖于通用视觉语言模型 (VLM),由于其 2D 图像文本预训练,这些模型缺乏几何推理和领域语义。为了解决这种不匹配问题,我们提出了 XEmbodied,这是一种云端基础模型,赋予 VLM 固有的 3D 几何感知以及与物理线索(例如占用网格、3D 框)的交互。 XEmbodied 没有将几何图形视为辅助输入,而是通过结构化 3D 适配器集成几何表示,并使用高效图像嵌入适配器将物理信号提取为上下文标记。通过渐进式领域课程和强化学习 后训练,XEmbodied 保留了一般功能,同时在 18 个公共基准中展示了强大的性能。它显着改进了大规模场景挖掘和体现 VQA 的空间推理、流量语义、体现可供性和分布外泛化。