论文

CrossVLA:视觉-语言-动作模型的跨范式 后训练 和推理优化

CrossVLA: Cross-Paradigm Post-Training and Inference Optimization for Vision-Language-Action Models

模型训练偏好优化

摘要

视觉-语言-动作 (VLA) 模型已迅速收敛于一小组架构模式:离散词元自回归(例如 OpenVLA)和连续动作流匹配(例如 pi-0.5)。然而,通过直接偏好优化 (DPO) 进行的偏好对齐(语言模型中事实上的 后训练 步骤)几乎完全在自回归 VLA 上进行了研究。我们提出了 CrossVLA,这是一项跨范式 VLA 后训练 的实证研究。三个贡献:(i) 替代流匹配对数概率估计器,使 DPO 在连续操作主干上运行,无需概率流 ODE 集成; (ii) 将 LoRA 和 DoRA 作为 VLA DPO 的参数高效层进行头对头比较,发现 DoRA 在 LIBERO 4 套件(600 次试验,3 个种子)中比 OpenVLA SFT 平均提高了 +10.4 pp - 每个套件 +20.0 对象,+11.0 长视野,+8.0 目标,+2.7 空间 - 对象上的种子方差为零(每个套件 38/50) 3 粒种子); (iii) 推理时间剖析显示,降噪循环主导了 78.6% 的sample_actions 延迟,并且 VLA-Cache 的前缀 K/V 缓存的加速上限为 21%——在我们的基准测试中,块级和 词元级 缓存策略都将成功率降低到 0-80%。我们在 6000 个 LIBERO 帧上进一步预训练多视图 + 时间投影头,实现相同任务检索的 99.5% k-NN 召回率@1(随机的 36 倍),可用作下游初始化。所有代码、ckpts、训练日志和复制脚本均在 https://github.com/lz-googlefycy/vla-lab 上开放。