论文

MobileEgo Anywhere:开放式基础设施,用于商用硬件上的长期以自我为中心的数据

MobileEgo Anywhere: Open Infrastructure for long horizon egocentric data on commodity hardware

AI 基础设施数据基础设施

摘要

视觉-语言-动作(VLA)模型推动了对大规模自我中心数据集的需求,但收集长期数据的硬件和基础设施仍然无法访问。如今的数据集通常只有几分钟长的片段,无法捕获复杂机器人任务执行所需的长期时间依赖性。我们推出了 MobileEgo Anywhere,这是一个用于在商用移动硬件上收集长达一个多小时的以自我为中心的轨迹的框架,该框架使用现代智能手机传感器进行长期姿势跟踪,而无需传统机器人数据收集的硬件障碍。我们发布了三个组件:(1) STERA,一个开源视频处理管道,可将原始移动捕获转换为标准化、可训练的格式,用于 VLA 和基础模型研究; (2) 一款免费的移动应用程序,允许任何用户记录以自我为中心的活动; (3) 200 小时的多样化、以自我为中心的长数据数据集,并在 584 个会话中进行持续状态跟踪。我们进一步证明该数据是一个可用的训练信号:在其上训练 VLA 可以降低保留的动作预测误差。