论文

行人路线的字幕介导的感知安全估计

Caption-Mediated Perceived-Safety Estimation for Pedestrian Routing

模型评测鲁棒性、公平性与可信度评测

摘要

本文提出了一种可解释的行人路线方法,其中通过明确的自然语言中间表示从街道级图像中估计感知安全性。在进行任何评分之前,会生成并存储视觉语言模型标题,并且感知风险类别完全从所存储文本的结构化特征中导出,以便用户可以检查每个片段分数。五个模型系列的九个字幕条件与相同下游管道下的直接对比语言图像预训练(CLIP)图像嵌入基线进行基准测试,并且发现字幕介导的表示与图像嵌入达到同等水平,而不是落后于图像嵌入。该方法部署了超过 654,115 张图像,覆盖英格兰北部两个地点(曼彻斯特和哈德斯菲尔德)的 36 个选区。对 70 个参与者会话中的 494 张图像的 3,669 个本地收集的评级进行独立现场验证,建立了具有统计显着性但适度的协议,$r=0.262$,而由于评级者之间的分歧而导致测量的噪音上限为 0.737。然后,一次性验证性测试发现,在监督基准上增强 44% 的管道并没有在现场产生可测量的改进($r=0.250$,$p=0.84$),因此基准收益并不能预测这种情况下的部署收益。路由行为随行程长度而系统地变化。 1 公里以下的变化可以忽略不计,低风险路线长度中位数增加了 12.78%,3 至 6 公里行程的中位绕道量为 2.73%。