论文

利用多模态 LLM 通过街景图像进行建筑环境和住房属性评估

Leveraging Multimodal LLMs for Built Environment and Housing Attribute Assessment from Street-View Imagery

应用与实践行业应用

摘要

我们提出了一种新颖的框架,利用 大语言模型 (LLM) 和 Google 街景 (GSV) 图像自动评估美国全国范围内的建筑状况。通过 微调 Gemma 3 27B 在一个适度的人类标记数据集上,我们的方法实现了与人类平均意见得分 (MOS) 的高度一致,相对于 MOS 基准,甚至优于 SRCC 和 PLCC 上的个人评分者。为了提高效率,我们应用 知识蒸馏,将 Gemma 3 27B 的功能转移到更小的 Gemma 3 4B 型号上,该型号可实现相当的性能并实现 3 倍的加速。此外,我们将知识提炼成基于 CNN 的模型 (EfficientNetV2-M) 和 Transformer (SwinV2-B),提供接近的性能,同时实现 30 倍的速度增益。此外,我们还研究了 LLM 通过人机人工智能一致性研究评估广泛的建筑环境和住房属性的能力,并开发了一个可视化仪表板,集成了 LLM 评估结果,供房主进行下游分析。我们的框架为大规模建筑状况评估提供了灵活高效的解决方案,以最少的人工标记工作实现高精度。