论文
RoboLab:用于分析任务通用策略的高保真模拟基准
RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies
摘要
对通用机器人技术的追求已经产生了令人印象深刻的基础模型,但由于性能快速饱和和缺乏真正的泛化测试,基于模拟的基准测试仍然是一个瓶颈。现有的基准通常在训练和评估之间表现出明显的领域重叠,从而忽视了成功率并模糊了对稳健性的洞察。我们推出 RoboLab,这是一个旨在解决这些挑战的模拟基准测试框架。具体来说,我们的框架旨在回答两个问题:(1)通过分析模拟中的行为,我们可以在多大程度上了解现实世界政策的表现;(2)哪个因素对政策行为的影响最强烈。首先,RoboLab 能够在高保真模拟环境中以与机器人和策略无关的方式生成由人类编写且支持 LLM 的场景和任务。我们引入了随附的 RoboLab-120 基准测试,其中包含 120 项任务,分为三个能力轴:视觉、程序、关系,跨越三个难度级别。其次,我们对现实世界的政策进行了系统分析,量化了它们的性能和行为对受控扰动的敏感性,揭示了当前最先进模型中的显着性能差距。通过提供精细的指标和可扩展的工具集,RoboLab 提供了一个可扩展的框架,用于评估任务通才机器人策略的真正泛化能力。项目网站:https://research.nvidia.com/labs/srl/projects/robolab/。