论文
更快更好?基准测试错误和设计限制扭曲了视觉-语言-动作加速的评估
Faster and Better? Benchmark Bugs and Design Limitations Distort the Evaluation of Vision-Language-Action Acceleration
摘要
模拟操作基准是评估视觉语言动作 (VLA) 策略和加速方法的标准工具,可减少机器人部署的推理延迟。在这些基准测试中,我们观察到一些近似基线策略计算的免训练加速方法比基线本身实现了更高的测量成功率。仅凭成功率无法确定这种收益是来自更好的任务执行还是来自评估缺陷。因此,我们研究了这些成果背后的两种基准缺陷:错误(实施与预期任务或评估协议不匹配)和设计限制(成功标准和模拟设置无法完全捕获加速如何影响任务执行)。从具有异常增益的任务开始,我们通过根据检查器接受区域绘制对象轨迹来定位根本原因,并将产生的错误分类为任务一致性、初始化和可复现性。将此审核扩展到七个基准测试,包括 RoboTwin、LIBERO-Plus 和 VLABench,我们发现了 22 个此类类型的错误和 4 个设计限制。对于后者,我们收紧了过于宽松的成功检查器,纠正了不切实际的物体质量,并添加了有利于更平滑动作的运动感知分数。实验表明,错误修复可以逆转方法排名,将一个任务的基线从最后移动到第一个。解决设计限制同样可以消除异常增益:在另一项任务中,基线从落后加速方法 21 个百分点变为领先 5 个百分点。因此,加速带来的收益可能是基准测试的产物,而不是更好的任务执行。我们发布了错误修复和修订的基准设置,以支持对 VLA 加速的可信评估。
