论文

ArmnetBench v0.1:低成本 Arm Farm 操纵策略的并行现实世界评估

ArmnetBench v0.1: Parallel Real-World Evaluation of Manipulation Policies on a Low-Cost Arm Farm

模型评测基准与评测资源

摘要

现实世界的评估是制定通用机器人操纵策略的瓶颈。每次执行轨迹评估都需要物理硬件和操作员来设置、重置和评分。我们推出了 ArmnetBench v0.1,这是在少量现场监督下在一组低成本 SO-101机械臂群上运行的基准测试。 v0.1 端到端验证了该手臂群,并比较了单臂和双手配置的 12 项任务中的 7 项策略。每项政策都经过针对每项任务 50 次演示的训练或微调;该基准包含 2,518 个政策展示和 600 个参考演示。所有 3,118 集都带有三向标签(成功、次优或失败)。策略执行轨迹是由人来评分的,而示范则由建设来成功。除了评估之外,其质量标记的轨迹还支持下游学习,从奖励和预测世界模型到基于混合质量数据训练的政策。排行榜是在此共享预算下的初步比较。我们以 LeRobot v3.0 和 RoboMeter 格式发布了 3,118 个核心剧集。