论文
LongBench:评估现实世界长视野任务的机器人操作策略
LongBench: Evaluating Robotic Manipulation Policies on Real-World Long-Horizon Tasks
摘要
机器人操纵策略通常会随着时间的推移而退化,但现有的基准对于此类故障发生的原因提供的了解有限。大多数先前的基准测试要么基于模拟,要么报告总体成功,因此很难区分现实世界执行中时间困难的不同来源。我们引入了 LongBench,一个用于评估长期操纵的现实基准。 LongBench 由 1,000 多个现实世界的片段组成,涵盖两种互补的机制:上下文无关(完全可观察)和上下文相关(模糊性驱动)。通过将任务组织成特定于功能和模糊性的子集,LongBench 能够对执行鲁棒性、时间一致性和上下文相关推理进行机制感知评估。评估六项最先进的政策表明,长期表现并非由单一因素决定。我们观察到,完全可观察的设置中的性能与执行鲁棒性密切相关,而上下文难度因任务而异,并且基于内存的方法并不能持续改善。我们希望 LongBench 能够成为研究长期操纵和制定应对执行和背景挑战的稳健政策的有用基准。