论文

StarVLA:用于视觉-语言-动作模型开发的类似乐高的代码库

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

AI 基础设施AI 开发与运维平台

摘要

构建多面手的具体代理需要整合感知、语言理解和行动,这些是基于多模态基础模型(包括视觉语言模型和世界模型的最新进展)的视觉-语言-行动(VLA)方法所解决的核心能力。尽管进展迅速,VLA 方法在不兼容的架构、代码库和评估协议中仍然支离破碎,阻碍了原则上的比较和可重复性。我们推出 StarVLA,一个用于 VLA 研究的开源代码库。 StarVLA 从三个方面应对这些挑战。首先,它提供了一个模块化的主干-动作头架构,支持 VLM 主干(例如 Qwen-VL)和世界模型主干(例如 Cosmos)以及代表性的动作解码范例,所有这些都在共享抽象下,其中主干和动作头都可以独立交换。其次,它提供可重复使用的训练策略,包括跨实体学习和多模式协同训练,这些策略在支持的范例中一致应用。第三,它通过统一的评估界面集成了LIBERO、SimplerEnv、RoboTwin~2.0、RoboCasa-GR1和BEHAVIOR-1K等主要基准,支持模拟和真实机器人部署。 StarVLA 还提供了简单、完全可重复的单基准训练方法,尽管数据工程很少,但已经在具有 VLM 和世界模型主干的多个基准上匹配或超越了先前的方法。据我们所知,StarVLA 是最全面的开源 VLA 框架之一,我们期望它能够降低复制现有方法和制作新方法原型的障碍。 StarVLA正在积极维护和扩展;我们将随着项目的进展更新这份报告。代码和文档可在 https://github.com/starVLA/starVLA 获取。