论文
IndustrialVLA-Bench:开放机器人策略模型的可追踪多轴评估
IndustrialVLA-Bench: A Traceable Multi-Axis Evaluation of Open Robot Policy Models
摘要
开放机器人策略越来越遵循两种范式:视觉语言动作模型(VLA)直接将观察和指令映射到动作,而世界动作模型(WAM)将学习的视频或世界动态纳入策略学习或动作生成中。尽管两者都针对相同的操作任务并代表替代的设计选择,但它们通常根据不同的评估协议进行报告,从而导致它们的功能、稳健性、语言敏感性和部署成本权衡不清楚。我们提出了 IndustrialVLA-Bench,这是在统一报告模式下对六个已发布的 VLA 和 WAM 系统进行的证据感知评估。它分别评估 LIBERO 上的清洁能力、LIBERO-Plus 上的非语言鲁棒性、LIBERO-Para 上的指令敏感性以及观察到的执行成本。报告的任务分数汇总了在固定检查点和推理配置下具有不同随机种子的三个完整评估。在所有六个系统中,干净的 LIBERO 平均值仅相差 1.58 分,而稳健性和释义摘要则相差 14.62 分和 31.08 分。限制与三个协议忠实系统的每次比较保留了效果(1.36、14.62 和 23.10 点),因此此处报告的诊断分离不依赖于较弱的证据层。我们还报告了观察到的推理延迟、峰值内存、运行时模式以及每个系统的证据状态。协议忠实的、接近复制的和待验证的条目仍然明显分开;只有忠实于协议的条目才支持严格比较。 IndustrialVLA-Bench 并没有声称任何一种范式都具有普遍优越性,而是提供了可追踪的证据,用于根据共享的实际标准比较已发布的机器人政策。代码和评估记录可从此 https URL 获取。