MINERVA:操纵政策有多小仍然可以解决 LIBERO 问题?
MINERVA: How Small Can a Manipulation Policy Be and Still Solve LIBERO?
摘要
具有数十亿参数的视觉-语言-动作(VLA)模型现在在 LIBERO 操作基准测试中占据主导地位,但该基准测试实际需要的模型容量仍不清楚。我们引入了 MINERVA(最小高效机器人视觉动作策略),这是一系列精心设计的紧凑视觉运动策略,旨在衡量特定任务的能力基础。 0.54M 参数策略在四个标准 LIBERO 套件上进行 2,000 次部署后,平均成功率为 95.1%,尽管使用的参数少了 7,700$\times$,但仅比报告的 LeRobot $π_{0.5}$ 结果低 2.4 个百分点。性能在 1M 参数附近饱和,并在 0.25M 以下崩溃。在广泛的架构、训练和推理扫描中,只有动作块长度和视觉能力始终超过 $\pm$1 点训练种子带。与跨三个种子的直接 L1 回归相比,流匹配没有提供任何可检测到的优势,而 GPU 上的回归速度最高可达 3.8$\times$。任务 ID 排列探测表明,标准 LIBERO 指令条件主要在记忆的任务中进行选择:仅更改任务 ID 映射会降低成功率。相同的配方在 89 项 LIBERO-90 任务中取得了 94.6% 的成功,而 LIBERO-Plus 扰动将性能降低至 46--56%,对光度变化的鲁棒性几乎为零。 0.54M 策略在笔记本电脑 CPU 上每块 5--9 毫秒内重新规划每个控制步骤,比 SmolVLA 快 113$\times$,比 $π_{0.5}$ 快 1,400$\times$,无需 GPU。这些结果建立了 LIBERO 特定任务容量下限的首次实证估计,并激发容量感知设计和 蒸馏 来实现高效部署的机器人策略。