论文
ACE-Data-0:以人为本的环境捕捉作为具体数据引擎
ACE-Data-0: Human-Centric Ambient Capture as Embodied Data Engine
摘要
具身智能面临着基本的数据瓶颈。模型必须捕捉第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随着人类追求目标而一起演变。现有的数据集将这种体验分割成不同的观点、模式或空间尺度,只留下部分观察到的完整的感知-行动循环。我们推出了环境捕捉引擎 (ACE),这是一种以人为中心的数据引擎,可将真实的家庭环境转变为空间校准、时间同步的录音室。 ACE 在两个互补的尺度上运行:桌面尺度配置解决了手部物体操作的问题,而房间尺度配置则捕捉整个身体的运动、移动和在家具齐全的房屋中的交互。 ACE 将自我中心和多视图外心视频、全身和关节式手部运动、物体几何和 6 自由度轨迹、音频和触觉信号记录为统一的多感官流。使用 ACE,我们构建了 ACE-Data-0,其中包含 200 个任务类别的 150 小时和 1700 万视频帧,由 50 名参与者在 2 个环境中执行,总共 75,000 个交互片段。该数据集涵盖原子操作、家庭活动的长视野链和人类场景交互,同时通过目标级别而不是逐步指令保留自然行为变化。我们进一步引入了一个分层基准,从信号到场景组件,然后再到交互。对最先进方法的评估揭示了接触、遮挡、自我运动和长期时间视野下的巨大差距。 ACE-Data-0 提供同步的人体演示,具有一致的感知、运动学和接触监督,为模仿学习、世界模型、视觉语言动作系统和具体人工智能提供可扩展的基础。