论文

VLM 能否通过行人级别图像可靠地评估人行道可达性属性?

Can VLMs Reliably Assess Sidewalk Accessibility Attributes from Pedestrian-Level Imagery?

模型评测鲁棒性、公平性与可信度评测

摘要

城市无障碍的一个重要组成部分,特别是对于轮椅使用者和行动不便的人来说,是人行道符合可衡量的要求。我们测试是否可以使用视觉语言模型(VLM)从行人图像中可靠地评估有效宽度、纵向坡度、横向坡度和路面状况。我们首次将基于采样的保形预测(CP)应用于基于 VLM 的可达性评估。我们利用来自韩国首尔的 514 张人行道图像以及现场测量的真值评估了 4 个 VLM。保形校准对所有模型和属性实现了标称 90% 的覆盖率,但校准区域的信息量有所不同。有效宽度产生信息最丰富的估计,最佳模型的平均间隔半宽度约为 1.0 m。由于每个模型都会高估宽度,因此在覆盖范围不变的情况下,非对称校准可将间隔缩短高达 33%。纵向坡度提供的信息很少,横向坡度间隔太宽,无法解决监管阈值,并且四种模型中的三种模型的路面条件集退化为所有五个等级(A-E)。原始采样分散的未校准间隔仅覆盖标称 90% 水平的现场测量值的 17-47%。在响应最一致的图像中,这些间隔在高达 96% 的情况下会错过现场测量值。因此,响应的自一致性并不是准确性的证据,并且采样离散度在根据现场测量的真值进行校准之前不能被解释为不确定性。没有任何定量属性达到一般合规性评估所需的精度,但 CP 仅从校准数据中识别哪些属性可以支持筛选远离阈值的细分。我们发布了带注释的行人级图像及其相应的现场测量属性值。