论文

GIF:用于机器人学习的交互式和功能对象组合的代理生成

GIF: Agentic Generation of Interactive and Functional Object Compositions for Robot Learning

模型训练合成数据

摘要

机器人操纵基础模型需要跨不同场景的可扩展评估和数据生成,而仿真为两者提供了环境。自动场景生成提供了一条有希望的道路,但之前的工作主要强调粗粒度的场景布局,而不是细粒度的功能对象组合。受这一差距的启发,我们提出了 GIF,一种用于交互式和功能对象组合的代理生成框架。在这个框架中,我们将这个问题重新定义为解纠缠重建,然后进行相对姿态恢复。 CoGen 利用 2D 和 3D 生成模型的互补优势,生成具有粗略初始姿势的实例解缠网格。 GPRM 在联合几何和物理指导下细化相对姿态,VLM 验证者选择最符合结构化规范的候选者。我们进一步构建了涵盖八个代表性接触几何类别的基准,并与最先进的生成器进行比较; GIF 提高了资产质量和关系匹配,同时将冲突率降低到 1% 以下。最后,我们综合用于政策学习的数据,揭示模拟和现实世界部署中的多样性扩展。