论文
通过视觉语言模型从自我中心视觉解码行人过路意图
Decoding Pedestrian Crossing Intention from Egocentric Vision via Vision Language Models
摘要
以自我为中心的视觉提供了人类感知和决策的第一人称视角,但其交通安全预测的潜力仍未得到充分开发。在这项工作中,我们研究了从以自我为中心的短视频片段中解码行人过路意图。我们通过将任务制定为封闭式视觉问答(VQA)问题并利用视觉语言模型(VLM)来预测行人的意图来解决这个问题。我们首先在零样本设置中对三个最先进的 VLM 系列进行基准测试,发现它们相对于随机猜测获得了适度的收益,但表现出有限的高级流量推理。受这些发现的启发,我们使用参数高效的 微调 进一步使 VLM 适应目标任务。我们的结果表明,经过微调的模型大大优于零样本模型,并且与基于专门的 Transformer 的基线相比,精度提高了 9%。最后,我们证明,结合额外的上下文线索,包括自我运动、车辆运动和眼睛注视,可以进一步提高预测性能。特别是,由眼睛注视和自我运动引导的微调 Qwen3-VL-2B 模型比 Transformer 基线提高了 14.5% 的准确度,为以自我为中心的行人意图解码建立了新的技术水平。