论文

S$^2$-VLA:用于长视野操纵的状态空间引导视觉语言动作模型

S$^2$-VLA: State-Space Guided Vision-Language-Action Models for Long-Horizon Manipulation

模型架构Transformer

摘要

视觉-语言-动作(VLA)模型在机器人操作方面表现出了强大的能力,但由于累积误差传播,它们的性能在长视野任务中显着下降。这种限制很大程度上源于静态特征融合机制,该机制依赖固定权重来组合视觉、语言和动作表示,从而阻止模型适应任务执行的不同阶段。为了解决这个限制,我们提出了 S$^2$-VLA,这是一个引入状态空间引导自适应注意力(SSGAA)机制的框架。 SSGAA 维持一种信念状态,跟踪任务进展并生成动态门控权重,以自适应地融合来自三个互补源的信息:用于空间感知的视觉特征、用于高级任务规划的任务意图以及用于执行一致性的时间动作序列。这种自适应融合允许模型在整个任务执行过程中转移焦点,以适应不同任务阶段不断变化的需求。尽管其 2B 参数大小紧凑,但 S$^2$-VLA 始终优于较大的 7B 规模模型,并在长视野操纵基准(包括 LIBERO 和 SimplerEnv)上实现了最先进的性能。强调了自适应特征融合对于长视距机器人操作的重要性。