论文

AI与人类专家推理对比:基于街景影像的建筑类型预测一致性评估

AI vs Human Expert Reasoning: Assessing Agreements in Building Typology Predictions based on Street View Imagery

模型评测模型能力评测

摘要

本研究考察视觉语言模型(VLM)从谷歌街景(GSV)影像推断建筑类型的潜力:建造方式、当前用途与层数。VLM生成的预测与人类专家(土木工程师与建筑师)的推断对比——后者作为人工标注真值来源。我们评估多个最先进VLM,包括GPT-4o、Claude 3.5 Sonnet与Gemini 2.0 Flash。应用不同缩放策略与提示技术后发现:思维链提示提供整体更稳定的模型表现。我们还经检查AI解释中关键词出现的概率考察VLM建筑类型预测背后的推理——使我们能分析这些推理的模式,并识别驱动VLM与专家标签之间一致与分歧的关键主题。我们发现:AI倾向于聚焦视觉指示物,而人类专家除视觉线索外更重视更广的上下文线索与领域知识。总体而言:VLM能以约70%的平均准确率规模化逼近专家的建筑类型分类能力。研究展示VLM在城市情境中需要模式识别与物体识别任务的AI自动化潜力;AI有潜力作为城市分析的互补协作工具——发挥其理解视觉模式的优势。本研究为AI视觉预测的效率与可扩展性探索做出贡献,并为可支撑城市分析与预测自动化的推理过程提供洞见。