论文

ATOM-Bench:操作策略中原子技能和组合泛化的现实基准

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies

模型评测基准与评测资源

摘要

通才操纵策略越来越多地被提出作为机器人控制的基础模型,但它们在现实世界中的普遍性仍然难以诊断。一项策略可能在已展示的任务上取得成功,但仍然无法执行细粒度的原子技能或在新的任务结构中重新组合学到的技能。我们引入了 \textbf{ATOM-Bench},这是一个用于评估操作策略中原子技能和组合泛化的现实基准。 ATOM-Bench 将桌面操作分解为运动原子和指令原子,并包含 30 个原子任务和 24 个跨配对单臂和双臂机器人轨道的保留组合任务。我们收集了 3,000 个原子 微调 的人类演示,并发布了演示数据和评估轨迹数据,以支持可重复的现实世界评估。策略针对原子任务进行微调,并针对原子技能获取和保留的组合任务进行评估。我们进一步引入原子分数(AS)和组合失败份额(CFS)来区分由弱原子技能引起的失败和由有限组合重用引起的失败。通过对五种代表性操纵策略进行 2,700 次物理部署,我们发现当前的策略可以获得简单指令对应的技能,但仍然难以处理细粒度的运动原子、计数和逻辑过滤。更重要的是,强大的原子性能并不能可靠地转移到保留的组合任务中。 ATOM-Bench 提供了一个诊断测试平台,用于研究故障是否是由电机执行能力弱、指令与实际对象对应不准确或组合重用有限引起的。