论文

通过基于 VQA 的事件地图为低视力人群提供城市风险意识导航

Urban Risk-Aware Navigation via VQA-Based Event Maps for People with Low Vision

应用与实践视觉感知与空间理解

摘要

视力障碍影响着全世界数亿人,严重限制了他们安全、独立地在城市环境中航行的能力。虽然可穿戴辅助设备为实时危险检测提供了一个有前途的平台,但现有方法依赖于缺乏灵活性和通用性的特定任务视觉管道。在这项工作中,我们提出了一种基于视觉问答的事件地图框架,利用视觉语言模型(VLM)在不同的现实世界环境中进行行人场景描述和危险识别,使用三级分层查询结构来实现细粒度的场景理解,而无需特定于任务的再训练。模型响应被汇总到一个加权风险评分系统中,该系统将街道段映射为四个离散的安全类别,从而为路线规划生成可导航的风险感知事件地图。为了支持评估和未来的研究,我们引入了一个跨越六大洲 20 个城市的地理多样化数据集,其中包含 800 多张带注释的图像和 18,000 个已回答的问题。我们对四种 VQA 架构(ViLT、LLaVA、InstructBLIP 和 Qwen-VL)进行了基准测试,发现生成式多模态 大语言模型 (MLLM) 的性能明显优于基于分类的方法,而 Qwen-VL 实现了精度和召回率的最佳总体平衡。这些结果证明了 MLLM 作为视障人士辅助导航系统灵活且通用的基础的可行性。