论文

基于 Mamba 的选择性状态空间建模改善了 SmolVLA 视觉-语言-动作专家的准确性与复杂性权衡

Mamba-based Selective State Space Modeling Improves the Accuracy-Complexity Tradeoff of SmolVLA Vision-Language-Action Experts

摘要

视觉-语言-动作(VLA)模型面临着任务成功率和策略调用频率之间的关键权衡。每个推理执行一个动作($N=1$)可以实现精确的机器人控制,但代价是巨大的计算时间开销,使得实时实现不可行。另一方面,在重新规划之前执行更长的操作范围 ($N\gg1$) 会降低计算复杂性,但不可避免地会降低系统的成功率。为了改善 VLA 准确性与复杂性的权衡,本文研究了 Mamba 的选择性状态空间建模,作为流行 SmolVLA 模型的动作专家中因果自注意力的替代方案,该模型因其高精度而低复杂性而被广泛用作参考模型。我们在广泛采用的 LIBERO 基准套件上评估基于 Mamba 和 Transformer 的专家,跨三个执行水平 $N\!\in\!\{1,25,50\}$,分别对应于高、中和低计算复杂度。我们的结果显着表明,Mamba 专家的优势随着执行范围的增加而增加,表明在长期执行范围 $N = 50$ 和 $N = 25$ 下成功保留率显着。当在重新规划之前执行 $N = 50$ 个操作时(即对应于可行的实时部署),Mamba 专家的性能优于 Transformer 基线 $7.8\%$。此外,当在重新计划之前执行 $N = 25$ 个操作时,我们的 Mamba 专家的性能比 Transformer 基线高出 $3.7\%$。最后,在每次操作重新规划 ($N=1$) 下,我们的 Mamba 变体与基于 Transformer 的平均成功率相匹配,同时由于 Mamba 的计算效率特性,将整体模型参数复杂性显着降低了 $24\%$。