论文

AnnotateAnything:自动注释用于机器人操作的 3D 资产

AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation

模型训练合成数据

摘要

模拟可以实现可扩展的机器人数据收集,但原始 3D 资产仅提供几何形状,缺乏指定机器人应在何处以及如何行动所需的语义、交互和物理知识。在这项工作中,我们提出了 AnnotateAnything,一个通用的自动注释框架,它将被动 3D 资产转换为具有结构化、多样化和可执行操作标签的可操作资产。 AnnotateAnything 是围绕两个互补的管道构建的。首先,统一的视觉语言注释管道使用视觉语言推理来推断对象语义、交互约束和 3D 线索,为识别有意义的交互区域提供人类先验指导。其次,全自动且大规模并行的物理注释管道通过候选生成、几何优化和轨迹生成,将这些先验基于每个资产的几何和物理约束。该管道产生多种可执行的动作注释,包括抓取姿势、灵巧接触、关节路径点、插入方向、悬挂可供性和导航目标。使用生成的注释,我们进一步构建跨不同对象、任务和机器人实施例的异步并行模拟数据收集系统。实验表明,与现有注释和数据生成管道相比,AnnotateAnything 实现了卓越的注释效率、数据收集效率和任务成功率,同时还支持下游任务,例如可供性检测、机器人 VQA 和视觉指令微调。我们在项目页面上提供项目材料,并计划发布完整的代码、注释和基准,以方便未来的研究。补充材料项目页面中提供了视频、代码、演示资源和注释:https://tourmaline-caramel-169490.netlify.app。