论文

VLA-REPLICA:视觉-语言-动作模型真实世界评估的低成本、可重复基准

VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

模型评测基准与评测资源

摘要

视觉-语言-动作 (VLA) 模型在通用机器人操作方面显示出强大的前景,但由于缺乏可访问、可重复和一致的基准,它们的实际评估仍然受到限制。模拟基准无法捕捉现实世界的复杂性,而现有的现实世界基准通常需要昂贵的硬件、集中评估或任务多样性有限。我们推出 VLA-REPLICA,这是一种低成本、易于重现的现实世界基准,用于评估 VLA 模型。我们的系统由现成的组件构建而成,可以在实验室之间快速组装和复制,为世界任何地方的政策评估提供一致的环境。 VLA-REPLICA 包括一套多样化的操作任务和一个用于目标域适应的小规模演示数据集,以及针对分布内和分布外设置的真实评估协议。模仿学习和最先进的 VLA 模型的实验揭示了模型的优点和局限性,而独立构建的设置中一致的结果证明了我们的基准的可重复性。