CritiqueDriveVLM:从验证者引导的强化学习到自动驾驶的潜在思想 蒸馏
CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving
摘要
端到端视觉语言模型(VLM)在自动驾驶方面显示出巨大的潜力。然而,标准监督 微调 (SFT) 经常遭受推理幻觉和保守偏见的困扰。虽然传统的工具增强框架和思想链 (CoT) 方法可以缓解这些问题,但它们会导致过高的词元消耗和不可接受的延迟,从而导致实时部署不切实际。为了解决这种可靠性与效率的权衡,我们提出了 CritiqueDriveVLM,这是一种新颖的统一三阶段框架,将推理直接内化到 VLM 中。首先,我们介绍由多维验证器引导的批评驱动的多轮强化学习(RL)。通过提供细粒度的标量反馈和多轮惩罚,我们迫使策略将逻辑推论内在化,培养一个强大的 System-2 Teacher,无需脆弱的外部工具即可实现高精度。随后,我们提出Latent Thought 蒸馏来克服延迟瓶颈。通过将学生的潜在表征与教师完全融合的推理状态相结合,我们将深层逻辑能力压缩到快速、无 CoT 的 System-1 学生中。对广泛使用的 DriveLMM-01 基准进行的大量实验证明了显着的改进。与基本模型相比,我们的免工具教师将多项选择质量 (MCQ) 从 55.54% 显着提高到了最先进的 76.54%。至关重要的是,我们经过提炼的 Student 保留了竞争性推理深度,同时将生成长度大幅缩短至平均仅 28 个标记。这将推理延迟减少了 88%(从 3482 毫秒减少到 416 毫秒),为低延迟自动驾驶铺平了一条高度稳健的途径。我们的源代码可在 https://github.com/MICLAB-BUPT/CritiqueDriveVLM 上获取。