论文
DriveReward:自动驾驶的综合数据集和生成视觉语言奖励模型
DriveReward: A Comprehensive Dataset and Generative Vision-Language Reward Model for Autonomous Driving
摘要
奖励模型在强化学习(RL)和自动驾驶的多模态轨迹选择中发挥着关键作用。然而,获得此类奖励通常依赖于手工制定的基于规则的目标或感知 真值,这阻碍了数据扩展的泛化。虽然视觉语言模型(VLM)已在其他领域证明了作为奖励模型的可行性,但它们在驾驶任务中的有效性仍未得到充分探索。在这项工作中,我们通过以下方式弥合了这一差距:(1) 引入 DriveReward,这是一个推理轨迹评估数据集,通过基于时间的视觉引导严格标记,并通过反事实驾驶行为进行增强。(2) 以及专门的视觉语言奖励模型。为了解决传统数据集中失败案例的稀缺问题,我们提出了一种反事实数据注释方案来构建包含不同驾驶风格和错误行为的案例。对我们提出的基准的评估表明,即使是领先的开源和专有 VLM 也无法在所有任务中表现出色,这凸显了现有模型的巨大改进空间。基于这些发现,我们随后定制了一个专门的 1B 奖励模型,该模型在特定任务奖励调整方面优于更大的 VLM。最后,我们通过将奖励模型集成到 RL 微调和跨多个基线的多模式轨迹评分中来验证奖励模型的有效性,从而在开环和闭环评估中实现与基于规则的奖励计算相当的性能。