论文
EnvDreamer:实体人工智能的大规模多模式到环境生成
EnvDreamer: Large-Scale Multimodal-to-Environment Generation for Embodied AI
摘要
大型数据集和高容量模型加速了视觉和语言方面的进步。这项工作引入了一个平台,旨在为具身学习、世界模型和机器人技术带来可比的收益。我们推出了 EnvDreamer,这是一个使用大型语言和视觉语言模型为实体 AI 和机器人训练生成虚幻引擎 5 环境的框架。 EnvDreamer 能够对训练的大型、多样化、交互式、可定制且通过验证器的虚拟环境进行采样,并跨导航、交互和操作进行评估。我们用大量生成的场景和简单的基线来说明该平台。 策略在 EnvDreamer 生成的环境上进行训练,无需显式映射或人工任务监督,即可在涵盖导航、重新排列和操作的多个具体基准上取得有竞争力的结果。 EnvDreamer 还支持用于真实到模拟研究的图像条件重建。最后,我们发布了 EnvDreamer-20k,这是一个由 20,000 个验证者通过的环境组成的数据集,其中包含任务程序、场景图、轨迹和元数据,以支持可重复的基准测试。
