论文
PEDESTRIANQA:行人意图和轨迹预测视觉语言模型的基准
PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction
摘要
行人意图和轨迹预测对于自动驾驶系统的安全部署至关重要,直接影响复杂交通环境中的导航决策。大型视觉语言模型的最新进展通过将高容量视觉理解与灵活的自然语言推理相结合,为这些任务提供了强大的新范式。在这项工作中,我们引入了 PedestrianQA,这是一个基于视频的大规模数据集,它将行人意图和轨迹预测制定为带有结构化原理的问答任务。 PedestrianQA 以自然语言表达丰富注释的行人序列,使 VLM 能够从视觉动态、上下文线索和交通代理之间的交互中学习,同时生成对其预测的简明解释,而无需为每个任务量身定制专门的架构。 PIE、JAAD、TITAN 和 IDD-PeD 的实证评估表明,在 PedestrianQA 上对最先进的 VLM 进行微调可显着提高意图分类、轨迹预测准确性和解释原理的质量,这证明了 VLM 作为安全关键行人行为建模的统一且可解释的框架的强大潜力。