论文

OmniVLA-RL:具有空间理解和在线强化学习的视觉-语言-动作模型

OmniVLA-RL: A Vision-Language-Action Model with Spatial Understanding and Online RL

模型训练强化学习

摘要

视觉语言动作(VLA)模型代表了嵌入式人工智能的范式转变,但现有框架经常面临不精确的空间感知、次优的多模态融合和强化学习的不稳定问题。为了弥补这些差距,我们提出了 OmniVLA-RL,这是一种新颖的架构,它利用 Mix-of-Transformer (MoT) 设计来协同集成推理、空间和动作专家。此外,我们引入了 Flow-GSPO,它将流匹配重新表述为随机微分方程(SDE)过程,并将其与组分段策略优化(GSPO)集成,以提高动作精度和训练鲁棒性。对 LIBERO 和 LIBERO-Plus 基准的广泛评估表明,OmniVLA-RL 取得了不错的整体性能并超越了主流现有方法,有效克服了当前 VLA 模型的根本局限性。