论文
CF-VLA:为视觉-语言-行动策略生成高效的从粗到细的行动
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
摘要
基于流的视觉-语言-动作(VLA)策略为动作生成提供了强大的表达能力,但存在根本性的低效率:需要多步推理才能从无信息的高斯噪声中恢复动作结构,导致实时约束下效率与质量的权衡较差。我们通过重新思考生成动作建模中起点的作用来解决这个问题。我们提出CF-VLA,而不是缩短采样轨迹,这是一种从粗到细的两阶段公式,它将动作生成重组为粗略的初始化步骤,构建动作感知的起点,然后进行单步局部细化以纠正残留误差。具体而言,粗略阶段学习端点速度的条件后验,以将高斯噪声转换为结构化初始化,而精细阶段则从该初始化执行固定时间细化。为了稳定训练,我们引入了一种逐步策略,首先学习受控粗预测器,然后执行联合优化。 CALVIN 和 LIBERO 上的实验表明,我们的方法在低 NFE(功能评估次数)制度下建立了强大的效率性能前沿:它始终优于现有的 NFE=2 方法,在多个指标上匹配或超过 NFE=10 $π_{0.5}$ 基线,将动作采样延迟减少 75.4%,并实现 83.0% 的最佳平均真实机器人成功率,优于 MIP 19.5 点,$π_{0.5}$ 增加 4.0 点。这些结果表明,结构化、从粗到细的生成可以实现强大的性能和高效的推理。我们的代码可在 https://github.com/EmbodiedAI-RoboTron/CF-VLA 获取。