论文
对通用机器人政策进行主动的基于现实世界因素的评估
Active Real-World Factor-Based Evaluation for Generalist Robot Policies
摘要
在大型、多样化的数据集上训练的通用机器人操纵策略在广泛的任务中显示出了非凡的前景。然而,严格评估这些政策仍然是一项根本挑战。现实世界的性能取决于任务因素的大量组合空间,包括物体姿势和相机视角,这使得全面、详尽的评估变得困难。此外,真正的硬件评估速度缓慢且占用大量资源,因此当前的做法是使用狭窄的测试套件,这可能会错过关键的故障模式并歪曲真实的部署准备情况。我们提出了一个主动评估框架,通过将政策评估视为顺序实验设计问题来应对这一挑战。我们的方法在任务因素的结构化空间上拟合概率代理模型,并自适应地选择评估配置,以最大化策略性能分布的信息增益,从而能够在未见的条件下对策略行为进行样本有效的表征,并系统地识别容易失败的区域。我们对具有 3 个因素变化的 3 个任务进行了 2331 次现实世界评估,发现与典型的随机测试相比,我们的方法通常可以为评估者节省至少 20-40% 的试验次数。