论文
SO-101 上的视觉-语言-行动模型基准测试:故障和恢复分析
Benchmarking Vision-Language-Action Models on SO-101: Failure and Recovery Analysis
摘要
视觉-语言-动作(VLA)模型在机器人操作方面表现出了很强的通用性,但现有的评估主要是在模拟或昂贵的机器人平台上进行的,而它们在经济实惠的现实世界机器人上的鲁棒性很大程度上尚未得到探索。我们提出了一个标准化的现实世界基准,用于评估低成本 SO-101 机器人平台上的代表性 VLA 和模仿学习策略。该基准包括四个代表性的操作任务以及统一的评估协议,从而能够在实施例不确定性下进行系统比较。使用真实世界的远程操作演示,我们直接在物理平台上微调和评估 $π_{0.5}$、SmolVLA、Wall-X 和 ACT。除了传统的任务成功率之外,该基准还结合了结构化故障分类、语义和执行级故障分解以及恢复感知评估指标来表征策略的稳健性。实验结果表明,更强的预训练 VLA 策略通常优于模仿学习基线,尽管在低成本机器人部署条件下性能仍然高度依赖于任务。执行不稳定成为主要的故障源,而不同架构的恢复能力差异很大。这些结果凸显了故障和恢复分析超越二元任务成功的重要性,并将 SO-101 确立为在现实的低成本机器人部署条件下评估嵌入式 AI 系统的实用基准。