论文
ObsDriveBench:以可观测性感知评测恶劣天气下的多模态理解
ObsDriveBench: Benchmarking Multimodal Understanding under Adverse Weather with Observability Awareness
摘要
恶劣天气下的自动驾驶仍是一项关键挑战,但现有视觉-语言基准主要在标准条件、合成损坏或单一模态下评估。因此,视觉-语言模型在真实恶劣天气与多模态输入下的表现仍不清楚。我们认为一个关键困难在于环境可观测性的退化:在雾、雨、雪与低光照下,多模态观测变得不可靠且跨模态不一致,给场景理解及后续决策带来挑战。为研究这一点,我们提出ObsDriveBench,一个面向恶劣天气自动驾驶的真实多模态基准。该基准围绕三个能力维度设计:可观测性感知、空间可靠性与风险感知决策,从而能在退化观测下对模型行为进行细粒度诊断。我们通过可观测性元标注、场景描述与面向能力的选择题任务,在同步的相机、LiDAR与雷达输入上构建该基准,形成包含超过14k训练题与13k测试题的基准。实验揭示了现有视觉-语言模型的持续性能退化。我们进一步提出ObsDrive模型,采用正常天气下的监督微调与恶劣天气下的强化学习,在全部三个能力维度上提升了鲁棒性。数据集与评估代码将在 https://github.com/russellyq/ObsDriveBench 发布。
