论文
ROAD-VLA:通过 Self-蒸馏 实现视觉-语言-动作模型的鲁棒在线适应
ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models
摘要
视觉-语言-动作(VLA)模型的有效在线适应仍然具有挑战性,因为稀疏的奖励为高维自回归动作策略提供了薄弱的监督。虽然 self-蒸馏 原则上可以提供更密集的训练信号,但我们发现以演示、检索经验或高级计划为条件的基于文本的特权教师对于 VLA 适应无效,暴露了符号指导和底层机器人动作之间的模态差距。我们提出了 ROAD-VLA,这是一种优势引导的自我 蒸馏 框架,它通过使用校准的优势估计扰乱动作词元 logits 来直接在动作空间中构建近端教师。这将稀疏的奖励转化为密集的 词元级 监督,同时使教师接近当前的政策。我们进一步推导出在校准优势和准确教师匹配下的政策改进下限。在七个具有分布内和分布外变化的机器人操作环境中,ROADVLA 在几乎所有设置中都优于 PPO,展示了强大的在线 VLA 适应能力。