论文

城市感知中视觉语言模型的基准应该具有可靠性意识并经过协商

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

模型评测基准与评测资源

摘要

视觉语言模型 (VLM) 越来越多地用于生成街道图像的结构化描述,以执行街景审计、测绘和公共咨询等任务。这些用途将可观察的属性与评估类别相结合,而人类目标通常是具有分歧和明确无反应的判断分布。本文认为,城市感知的基准 VLM 应该将分歧和弃权视为测量结果,报告注释者间的可靠性以及模型对齐,并在输出旨在为城市治理提供信息时将标签空间和评分政策视为可协商的工件。我们将这一论点建立在由来自 7 个社区组织的 12 名参与者沿 30 个维度注释的 100 个蒙特利尔街道场景的基准以及对 7 个 VLM 的确定性零样本评估中。在各个维度上,模型与人类共识的一致性与维度级别的人类可靠性共同变化,并且对于评估维度整体印象模型和注释者表现出分布不匹配,包括不同的不适用率。最后,我们为基准创建者、模型开发者和机构采取行动,使不确定性和基准假设在评估报告中可见。