论文
HALTER:用场景图组织长程机器人操作评测与自动复位
From Rollout to Reset: A Graph-Based Harness for Autonomous Long-Horizon Manipulation Evaluation
摘要
机器人操纵政策正在迅速改进,真实的机器人评估仍然是这一进展的标准证据。它仍然依赖于人工在两次执行轨迹之间重置场景,这会消耗操作员时间并且导致初始状态分布未指定,因此结果重现性很差。最近的系统 AutoEval 可以自动执行重置和评分,但仅限于单步任务,因为长期部署可能会以组合的许多配置终止,而单个学习的重置策略无法涵盖这些配置。我们执行轨迹了 HALTER,一种用于自主长视野任务评估和重置的工具,它通过规划学习的原子重置技能库来恢复场景,因此演示成本与该库的大小而不是最终状态的数量成比例。 HALTER 从点云和视觉基础模型在线构建空间场景图,大语言模型对该图进行推理以对部署进行评分、计划重置并验证重置是否成功,而无需收集任何任务的标记成功图像。在 Franka 手臂上执行的四项长视野任务中,HALTER 在 76% 的剧集中恢复了场景,而 AutoEval 为 52%,运动计划重置为 65%,并且它在 90% 的剧集中正确估计了完成技能分数,而 AutoEval 为 76%。其重置验证判决在 91% 的事件中是正确的,而 AutoEval 的正确率为 78%。相对于手动重置,它还可以将评估活动的操作员时间缩短 72%。我们进一步测量了三个保留任务的组合泛化,其中 HALTER 重置了 74.7% 的情节,而每个任务重置策略为 1.3%,并且我们消除了场景表示和图形更新率。