论文
你不能两次拍摄同一条街道:城市变化视觉语言测量的可靠性限制
You Cannot Photograph the Same Street Twice: Reliability Limits in Vision-Language Measurement of Urban Change
摘要
视觉语言模型越来越多地用于通过重复的街道图像来衡量城市变化,但其纵向可靠性尚不清楚。我们测试了当街道本身没有进行实质性重建时,感知得分会发生多大的变化。使用来自美国五个城市 435 个 Google 街景视角的 4,648 个连续纪元图像对,我们发现重新拍摄同一条街道的感知得分平均会改变 0.80 分,相当于同一城市两条不同街道之间差异的 66.5%。重复的模型调用几乎不会造成任何变化,而图像重新编码和提示顺序更改分别约占街道间差异的五分之一。描述散射、对比度、颜色、曝光、清晰度和镜面反射度的六种图像统计数据几乎无法解释剩余的历元变化。大约 0.1 点的小系统漂移仍然存在,并随着捕获之间的间隔而增加,这与重建标签未记录的微小物理变化一致。受控实验进一步表明,当允许相机和图像属性变化时,采集条件可能会改变分数,并且这些改变的方向取决于模型。在众包图像中,仅相机几何形状就会导致模型报告 45% 的相同场景对的物理变化;将两个图像标准化为通用虚拟相机可将该比率降低至 7.5%。尽管单个位置层面的可靠性较差,但聚合恢复了连贯的重建信号:改变后的街道被认为更富裕、维护得更好、更封闭、绿化程度更低。这些结果表明,城市变化的视觉语言测量在数百个配对观察的规模上是可靠的,但在单个样本点的规模上并不可靠。