论文
AffordCraft:从单个图像构建任务就绪的模拟资产
AffordCraft: Scalable Construction of Task-Ready Simulation Assets from Single Images
摘要
机器人在模拟中的学习取决于模拟器提供的对象。许多任务需要具有独立部件、允许所需运动的关节以及在接触下保持有效的物理属性的对象。现有方法为每张图像重新恢复这种结构:生成模型预测在模拟中大多数无法稳定或移动的零件和关节,而通用智能体需要为每张照片进行长时间的模型调用。 AffordCraft 通过检索(而不是生成)从单个 RGB 图像和任务指令构建这样的资产:它定位对象和要操作的部件,从铰接资产库中选择匹配的条目,并将其适合图像,同时保持其部件和关节完好无损。在没有任何框或掩模标记对象的情况下,AffordCraft 为 31 个类别的 2,000 张照片中的 1,703 张生成了物理有效的资产。五种生成方法最多传递 45% 的相同照片,平均每个有效资产需要 10 到 78 倍的 GPU 时间。在 50 张杂乱的图像上,237 个带注释的对象中的 162 个在自动检测后通过了相同的物理测试。将库的条目从 141 个增加到 11,372 个,无需更改方法,并将类别覆盖率从 46% 提高到 100%,并将具有所需标签的选择比例从 18% 提高到 51%。我们还从构建的资产中构建操作任务,无论是单个对象还是在组合场景中;经过脚本化演示训练的策略可以从训练中未见的初始状态完成这两种任务。
