论文
机器人数据工厂
The Robot Data Factory
摘要
物理人工智能需要的不仅仅是日益庞大的机器人数据集:智能机器人通过与物理世界的持续交互来获取知识。因此,我们认为,物理人工智能的定义科学资源不仅仅是原始机器人数据,而是机器人体验——基于物理的交互,其观察、行动、体现、背景和结果保留了感知-行动-结果循环。我们引入了机器人数据工厂(RDF),这是一种任务驱动的基础设施和方法,用于持续生成、验证、基准测试和重用此类经验。 RDF 通过可重复的任务、技能课程、同步多模态传感、外部真值、代理机器人网络、数据管道和生活基准来组织异构机器人和特定环境的训练场。 RDF 没有将数据集视为静态最终产品,而是实现了一个封闭的部署-测量-学习-重复循环,其中经过验证的物理经验支持世界模型、视觉-语言-动作模型、具体策略、数字孪生和后续机器人部署。我们进一步将机器人体验及其质量形式化,引入任务-任务-技能-片段-数据集-基准-能力层次结构,并推导出定量缩放定律和算法综合程序,将机器人车队规模、传感器速率、存储、学习表示、标记化、训练计算、推理和延迟与嵌入式人工智能集群要求联系起来。该框架在三个互补的物理训练场中实例化,用于家庭、环境和能源应用。因此,RDF 将机器人数据生成重新构建为一个连续的科学生产过程,并为物理 AI 的可重复、可扩展和最终联合基础设施提供了一条途径。