论文
RT-VLA:通过 知识蒸馏 的实时视觉-语言-动作模型
RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation
摘要
视觉-语言-动作(VLA)模型通过联合建模视觉感知、语言推理、可解释性和动作预测,显示出端到端自动驾驶的强大潜力。然而,它们的大型视觉语言主干和推理模块引入了大量的推理延迟,从而阻碍了它们在道路网络的残酷现实中的部署。我们提出了 RT-VLA,这是一种轻量级、精炼的 VLA 模型,通过多级监督 蒸馏 将最先进的 SimLingo 模型的驱动和推理能力转移到紧凑的学生中。 RT-VLA 保留了基于语言的推理,并通过对安全关键驾驶时刻的离线语言分析来支持事后解释,而不会增加实时控制的延迟。与 SimLingo 老师相比,RT-VLA 保持了有竞争力的闭环驱动和语言推理性能,同时在纯视觉模式下推理时间缩短了 44.8 倍,在视觉+语言模式下推理时间缩短了 7.9 倍。这些结果表明,有监督的 蒸馏 是构建实时、可解释的 VLA 式自动驾驶模型的实用方法。