论文

超越最终任务的成功:如何审核机器人技术中的视觉体验检索

Beyond End-Task Success: How to Audit Visual Experience Retrieval in Robotics

模型评测评测方法与指标

摘要

存储过去经验的机器人必须选择在新场景中重用哪一个。大多数系统通过视觉相似性进行选择,并且大多数评估仅报告所选体验的成功。这个数字并不能表明选择是否良好:一条规则可以通过重复使用一种广泛可转移的经验而得分很高,或者因为其首选经验较弱而得分较差。由于机器人越来越多地通过重用而不是再训练来适应,因此描述库而不是规则的分数会误导该领域下一步构建的内容。我们贡献了一种审计方法:在每个查询场景中执行每个存储的经验,超过两个操作任务,三种重用机制,以及$K=3$、$10$和$50$的库。由于每个替代方案的结果都是已知的,因此可以根据每个场景的选择或库质量来追踪分数。审核的规则根据五种视觉嵌入中的最近邻距离进行选择,从原始像素到 CLIP。 (1) 事后选择的一项固定经验,可以弥补随机选择和预言之间 30-58% 的差距;每个场景的选择会争夺剩余的 0.07-0.15 的成功率。 (2) 在 $K\ge10$ 下,视觉规则集中于一种体验的程度是预言机的 1.5-3 倍,然后它们的分数遵循该体验的质量。 (3) 只要规则与保持其选择率但将它们与场景随机配对的洗牌显着不同,则对于每个学习的图像策略,该规则都更糟糕。 (4) 视觉距离可以很好地预测给定的一对是否会成功(AUROC 高达 0.96),但在一个场景中对候选者进行排名并不比 $K=50$ 时五个嵌入中的四个的机会更好(AUROC 0.45-0.52)。详尽的执行通常是不可行的,因此审计减少为任何研究都可以提供的两个廉价报告:所选经验的分布,以及事后看来最佳单一经验的成功。