论文
vla-eval:视觉-语言-动作模型的统一评测框架
vla-eval: A Unified Evaluation Harness for Vision-Language-Action Models
摘要
视觉语言动作 VLA 模型通常使用每个模型存储库独立维护的每个基准脚本进行评估,从而导致重复代码、依赖性冲突和未指定的协议。我们推出了 vla eval,这是一个开源评估工具,它通过 WebSocket msgpack 协议和基于 Docker 的环境隔离将模型推理与基准测试执行分离。模型通过实现单个 Predict() 方法集成一次;基准测试通过四方法接口集成一次;完整的交叉评估矩阵会自动运行。完整的评估只需要两个命令:vla evalserve 和 vla eval run。该框架支持 13 个模拟基准和 6 个模型服务器。通过剧集分片和批量推理进行并行评估,吞吐量提高了 47 倍,在大约 18 分钟内完成了 2000 个 LIBERO 剧集。使用此基础设施,我们对已发布的 VLA 模型跨三个基准进行了可重复性审核,发现所有三个模型都紧密地再现了已发布的值,同时发现了未记录的要求、模糊的终止语义和隐藏的标准化统计数据,这些统计数据可能会默默地扭曲结果。我们还发布了 VLA 排行榜,汇总了 17 个基准的 657 个已发布结果。框架、评估配置和所有复制结果都是公开的。
