论文

PhAIL:真实机器人 VLA 基准和分布式方法

PhAIL: A Real-Robot VLA Benchmark and Distributional Methodology

模型评测基准与评测资源

摘要

视觉-语言-行动(VLA)策略的现实世界评估仍然依赖于固定超时下的二元成功率,每个条件有 $N \le 25$ 的轨迹采样,几乎总是没有置信区间或配对统计比较;这些队列规模很难可靠地进行密切比较。我们引入了 PhAIL(物理 AI 排行榜,https://phail.ai),这是一种基于 Franka FR3(数据集、每次轨迹采样工件和端到端参考实现)的分布式评估方法的开放真实机器人基准:成功时间累积分布函数(CDF)作为评估原语,具有两个独立的作业。第一个是通过人类相对吞吐量(HRT)进行评分,这是一个具有引导置信区间的无量纲标量,锚定于相同装置的人类远程操作。第二个是显着性检验(Kolmogorov-Smirnov,按对象计算并跨对象进行宏观平均)。在四个公开可用的 VLA 上,宏观平均 KS 测试在每个(模型、对象)单元格中以 $N \le 30$ 的轨迹采样量解决了两次密切比较(GR00T 与 ACT、OpenPI 与 ACT),而二进制阈值指标则无法解决;最接近的一对(OpenPI 与 GR00T)在我们的预算范围内仍未解决。最佳评估的 VLA 每次操作(RMST 比率)比人类参考慢 $\sim 7\times$。