论文
SABER:用于现实世界 VLA 适应的可扩展的基于动作的具身数据集
SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation
摘要
现实环境中的机器人部署不仅依赖于强大的模型架构,还依赖于丰富的、特定领域的操作数据。通用机器人基础模型在复杂的看不见的任务中表现出适度的性能,例如开箱即用的零售领域的操作。根本原因是数据差距:零售环境在结构上不存在于一般机器人预训练分布中,而通过远程操作填补这一空白的途径成本高昂、物流受限且难以扩展。我们推出 SABER,这是一个高保真零售机器人动作数据集,由跨多个真实杂货环境的 100 多个小时的自然店内捕获构建而成。来自头戴式摄像机的以自我为中心的镜头记录了交互时的细粒度手部活动,而来自 DreamVu ALIA 摄像机的外心 360 度场景镜头则同时观察整个空间中的所有演员和活动。这种组合产生了人类零售行为的独特完整图景:灵巧的手部活动、全身运动和场景动态,所有这些都无需上演、脚本或远程操作即可捕获。 SABER 语料库包含跨三个动作表示流的 44.8K 训练样本:通过 LAPA 式编码的 25K 潜在动作序列、重定向到机器人关节空间的 18.6K 灵巧手势轨迹以及重定向到人形实施例的 1.2K 全身同步运动序列。当通过共享主干多任务 后训练 配方应用于 GR00T N1.6 时,SABER 在 10 项零售操作任务中的平均成功率为 29.3%,是 微调 基线 (13.4%) 的 2.19 倍以上。 SABER 证明,通往强大零售机器人的道路需要更好的数据,这些数据现在可以大规模收集,而无需机器人参与。数据集和代码可在 https://dreamvu.ai/saber 获取