论文
StarVLA-$α$:降低视觉-语言-动作系统的复杂性
StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems
摘要
视觉-语言-动作(VLA)模型最近已成为构建通用机器人代理的有前途的范例。然而,VLA 格局仍然高度分散和复杂:因为现有方法在架构、训练数据、实施例配置和特定基准工程方面存在很大差异。在这项工作中,我们引入了 StarVLA-$α$,这是一个简单但强大的基线,旨在研究受控条件下的 VLA 设计选择。 StarVLA-$α$ 故意最小化架构和管道的复杂性,以减少实验混杂因素并实现系统分析。具体来说,我们重新评估了几个关键的设计轴,包括动作建模策略、机器人特定的预训练和界面工程。在 LIBERO、SimplerEnv、RoboTwin 和 RoboCasa 上的统一多基准训练中,相同的简单基线仍然具有很强的竞争力,这表明强大的 VLM 主干与最小的设计相结合已经足以实现强大的性能,而无需依赖额外的架构复杂性或工程技巧。值得注意的是,我们的单一通才模型在公共现实世界 RoboChallenge 基准测试中的性能比 $π_{0.5}$ 高出 20\%。我们预计 StarVLA-$α$ 能够成为 VLA 体系未来研究的坚实起点。代码将在 https://github.com/starVLA/starVLA 发布。