论文
XS-VLA:利用空间监督和演示调节来教学微型视觉-语言-动作模型
XS-VLA: Teaching Tiny Vision-Language-Action Models with Spatial Supervision and Demonstration Conditioning
摘要
更丰富的训练监督如何在保持部署策略紧凑的同时改善机器人控制?我们提出了 XS-VLA,这是一个使用教师衍生的空间标签和演示条件动作学习的分阶段训练框架。粗粒度空间 蒸馏 (CSD) 通过辅助区域标签任务初始化主干网。然后,潜在流匹配 (LFM) 使用 KL 正则化,同时联合优化主干和动作模块,以演示潜在的动作空间速度场为条件。部署的策略包含 243.99M 个参数,并且无需教师或后验编码器即可运行。 XS-VLA 在两个训练种子中的每一个中均实现了 90.25% 的平均 LIBERO 成功率,而在我们的设置下训练的 SmolVLA-256M 基地的成功率为 86.00%。 Ablations 通过匹配图像预训练和 Huber/MSE 控制来检查两个训练阶段。在三项 Mobile ALOHA 任务中,平均严格成功率从 21.7% 增加到 65.0%。这些结果证明了辅助表示初始化和正则化演示条件流学习对于紧凑 VLA~策略的控制效用。