论文

高效视觉-语言-行动策略的离线语义指导 蒸馏

Offline Semantic Guidance for Efficient Vision-Language-Action Policy Distillation

摘要

数十亿参数的视觉-语言-动作(VLA)策略最近在机器人操作方面表现出了令人印象深刻的性能,但其规模和推理成本仍然是实时闭环控制的主要障碍。我们引入了 \textbf{VLA-AD},这是一个 蒸馏 框架,它使用视觉语言模型作为离线语义监督器,将大型 VLA 教师转换为轻量级学生策略。 VLA-AD 不是仅仅依赖于低级动作模仿,而是通过高级语义指导(包括任务阶段锚点和多帧操作方向描述)来增强教师提供的 7-DoF 动作目标。这些辅助信号仅在训练期间使用:在测试时,学生策略独立运行,不需要 VLA 教师或 VLM。我们在三个 LIBERO 基准套件上评估 VLA-AD。使用 OpenVLA-7B 作为教师,我们的方法产生了一个 158M 参数的学生,模型大小减少了 $44\times$,同时与教师的平均相对差距仅为 $0.27\%$。由此产生的策略在 RTX 4090 上以 12.5 Hz 运行,与 OpenVLA-7B 相比实现了 3.28 美元×$ 的推理加速。我们进一步表明,相同的语义 蒸馏 管道可以推广到不同的 $π_{0.5}$-4B 老师,其中学生在两个套件上优于老师,并且在 \texttt{libero\_goal} 上保持在 $0.53\%$ 以内。额外的分析表明,阶段级监督和多帧方向提示使学生对嘈杂的教师动作(例如错误的高频夹具变化)不太敏感。总体而言,VLA-AD 表明,VLM 的离线语义指导可以显着提高 VLA 策略 蒸馏 的效率、稳健性和可部署性。