论文
VLA Foundry:训练视觉-语言-动作模型的统一框架
VLA Foundry: A Unified Framework for Training Vision-Language-Action Models
摘要
我们推出了 VLA Foundry,这是一个开源框架,它将 LLM、VLM 和 VLA 训练统一在一个代码库中。大多数开源 VLA 工作专注于动作训练阶段,通常将不兼容的预训练管道拼接在一起。相反,VLA Foundry 提供了一个具有端到端控制的共享训练堆栈,从语言预训练到动作专家 微调。 VLA Foundry 支持从头开始训练和 Hugging Face 的预训练骨干网。为了展示我们框架的实用性,我们训练并发布了两种类型的模型:第一种模型通过我们的 LLM-->VLM-->VLA 管道从头开始完全训练,第二种模型基于预训练的 Qwen3-VL 主干。我们在开放数据、开源模拟器 LBM Eval 上评估这两个模型的闭环策略性能。我们还改进了模拟器和 STEP 分析工具的可用性,以方便公众使用。在名义评估设置中,我们完全开放的从头开始模型与我们之前的闭源工作相当,并且替换 Qwen3-VL 主干网络会导致强大的多任务桌面操纵策略,其性能大大优于我们的基线。 VLA Foundry 代码库可在 https://github.com/TRI-ML/vla_foundry 上获取,所有多任务模型权重均在 https://huggingface.co/collections/TRI-ML/vla-foundry 上发布。项目网站 https://tri-ml.github.io/vla_foundry 上提供了其他定性视频。