论文
GEM:生成监督有助于体现智能
GEM: Generative Supervision Helps Embodied Intelligence
摘要
体现视觉语言模型(VLM)在机器人技术中展示了令人印象深刻的性能和泛化性,特别是在视觉语言动作框架内。然而,标准文本引导的 预训练 范式的高级语义焦点与在具体环境中执行至关重要的低级空间和物理知识之间仍然存在显着差距。在本文中,我们介绍了 GEM,一种生成监督的具体视觉语言模型,旨在弥合这一鸿沟。我们建议将深度图生成任务直接集成到 VLM 预训练 阶段。通过与主模型联合训练这个生成目标,我们观察到体现智能的显着改进,显着增强了语义理解和物理操作能力。为了支持这一范式,我们策划并发布了 GEM-4M,这是一个综合性大型数据集,融合了基础、推理和规划数据以及高质量的深度监督。大量实验表明,GEM 在不同的具体基准中取得了最先进的结果。此外,我们部署的动作模型 GEM-VLA 在模拟环境和现实评估中都表现出了极其优越的任务执行能力。代码、模型和数据集可在 https://zhaorw02.github.io/GEM/ 获取