论文

VLM 能看到传感器的感受吗?街景轮椅无障碍评估的可扩展专家指导设计

Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View

上下文与知识检索增强

摘要

评估建筑环境的交互(例如轮椅的可达性)是很困难的,因为现实世界的流动性是由分布式的、依赖于环境的临时障碍所塑造的,而这些障碍很难大规模捕捉。为了支持可扩展的评估,本文研究了视觉语言模型 (VLM) 是否可以识别 Google 街景 (GSV) 图像中的可访问性障碍。我们提出了一个专家引导的检索增强框架,该框架结合了 GSV 图像、ADA 信息指导和专家衍生的评估标准来评估可访问性维度。我们在佛罗里达大学收集了一个校园规模的数据集,将 407 个独特的 GSV 位置与 GPS 衍生的轮椅停留行为作为移动摩擦信号联系起来。结果表明,VLM 评分与停留时间呈负相关且分布相似,表明与移动摩擦的行为代理部分但一致。视觉线索分析表明,某些环境物体(例如路缘坡道和人行横道)与较高的 VLM 可达性分数相关,而对于微妙的表面条件、短暂的障碍物和依赖于视点的障碍物,对齐仍然受到限制。总体而言,我们的研究结果表明,专家引导的 VLM 在可扩展的无障碍评估方面具有潜力,与现实世界轮椅导航的传感器衍生指标相一致。