论文

RailVQA:自动列车运行中高效可解释视觉认知的基准和框架

RailVQA: A Benchmark and Framework for Efficient Interpretable Visual Cognition in Automatic Train Operation

模型评测基准与评测资源

摘要

随着列车自动运行 (ATO) 向 GoA4 及更高版本发展,它越来越依赖于高效、可靠的驾驶室视觉感知和决策导向的推理,以确保在复杂和动态的铁路环境中安全运行。然而,现有方法主要关注基本感知,并且通常很难推广到罕见但安全关键的极端情况。他们还缺乏运营决策所需的高级推理和规划能力。尽管最近的大型多模态模型(LMM)显示出强大的泛化和认知能力,但它们在安全关键型 ATO 中的使用受到高计算成本和幻觉风险的阻碍。与此同时,仍然缺乏用于系统评估认知能力的可靠的特定领域基准。为了解决这些差距,我们引入了 RailVQA-bench,这是 ATO 中第一个用于驾驶室视图视觉认知的 VQA 基准,包括 20,000 个单帧和 1,168 个基于视频的 QA 对,用于评估静态和动态场景中的认知泛化和可解释性。此外,我们提出了 RailVQA-CoM,这是一种协作的大小模型框架,通过透明的三模块架构和自适应时间采样将小模型效率与大模型认知结合起来,提高感知泛化并实现更有效的推理和规划。实验表明,所提出的方法大大提高了自动驾驶系统的性能,增强了可解释性,提高了效率,并加强了跨域泛化。代码和数据集将在 https://cybereye-bjtu.github.io/RailVQA.html 提供。