论文

AffordCraft:从单个图像构建任务就绪的模拟资产

AffordCraft: Scalable Construction of Task-Ready Simulation Assets from Single Images

智能体系统Agent 环境交互

摘要

机器人在模拟中的学习取决于模拟器提供的对象。许多任务需要具有独立部件、允许所需运动的关节以及在接触下保持有效的物理属性的对象。现有方法为每张图像重新恢复这种结构:生成模型预测在模拟中大多数无法稳定或移动的零件和关节,而通用智能体需要为每张照片进行长时间的模型调用。 AffordCraft 通过检索(而不是生成)从单个 RGB 图像和任务指令构建这样的资产:它定位对象和要操作的部件,从铰接资产库中选择匹配的条目,并将其适合图像,同时保持其部件和关节完好无损。在没有任何框或掩模标记对象的情况下,AffordCraft 为 31 个类别的 2,000 张照片中的 1,703 张生成了物理有效的资产。五种生成方法最多传递 45% 的相同照片,平均每个有效资产需要 10 到 78 倍的 GPU 时间。在 50 张杂乱的图像上,237 个带注释的对象中的 162 个在自动检测后通过了相同的物理测试。将库的条目从 141 个增加到 11,372 个,无需更改方法,并将类别覆盖率从 46% 提高到 100%,并将具有所需标签的选择比例从 18% 提高到 51%。我们还从构建的资产中构建操作任务,无论是单个对象还是在组合场景中;经过脚本化演示训练的策略可以从训练中未见的初始状态完成这两种任务。

AffordCraft:从单个图像构建任务就绪的模拟资产的原论文方法或结果图
图 1:AffordCraft 概述。 (a) 一张杂乱的照片,上面有要建造的物体;该任务将微波炉命名为(橙色)。 (b) 检索按外观对库条目进行排名,多模式模型根据其零件和关节选择第四个。 (c) 建造资产、运营部分驱动和着色。 (d) 资产组成一个场景,其中脚本化的教师模型打开微波炉门(右:缩放)。 (e) 每个接受的资产所接受的份额和 GPU 分钟数,如表 1 所示,适用于本机并进行其他调整(最后两行:200 个输入子集)。