论文
A1:开放训练流程的低成本自适应视觉语言动作模型
A1: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
摘要
视觉-语言-动作 (VLA) 模型已成为开放世界机器人操作的强大范例,但其实际部署往往受到成本的限制:数十亿级的 VLM 主干和基于迭代扩散/基于流的动作头会产生高延迟和计算量,使得实时控制在商用硬件上变得昂贵。我们推出了 A1,一个完全开源且透明的 VLA 框架,专为低成本、高吞吐量推理而设计,且不会牺牲操作成功率;我们的方法利用预先训练的 VLM,为动作生成提供隐含的可供性先验。我们发布了完整的训练堆栈(训练代码、数据/数据处理管道、中间检查点和评估脚本)以实现端到端的可重复性。除了单独优化 VLM 之外,A1 还通过引入预算感知自适应推理方案来共同加速主干网和行动头,从而实现完整的推理管道。具体来说,我们监控中间 VLM 层的动作一致性以触发提前终止,并提出层间截断流匹配来热启动跨层去噪,从而以更少的有效去噪迭代实现准确的动作。在模拟基准(LIBERO、VLABench)和真实机器人(Franka、AgiBot)中,A1 实现了最先进的成功率,同时显着降低了推理成本(例如,流匹配推理的每次任务执行的延迟降低高达 72%,主干计算减少高达 76.6%,性能略有下降)。在 RoboChallenge 上,A1 的平均成功率为 29.00%,优于 pi0(28.33%)、X-VLA(21.33%)和 RDT-1B(15.00%)等基线。