论文

SVI2LoD3:使用大语言和视觉模型根据自愿街景图像在语义 3D 城市模型中以代理驱动重建 LoD3 立面开口

SVI2LoD3: Agent-Driven Reconstruction of LoD3 Facade Openings in Semantic 3D City Models from Volunteered Street View Imagery using Large Language and Visual Models

应用与实践视觉感知与空间理解

摘要

本文提出了一种端到端、代理驱动的管道,用于 3D 城市模型中立面开口的 LoD3 重建,生成直接可用的符合 CityGML 的输出。与依赖监督语义分割并因此需要大量手动注释训练数据的现有方法相比,所提出的方法采用零样本分割策略。这大大减少了注释工作,同时在 eTRIMS 数据集的基准测试中仍然实现了出色的性能。另一个关键贡献是执行正确的部分层次结构,从而生成符合 CityGML 的 LoD3 建筑模型。除了重建管道本身之外,这项工作还引入了一种新颖的立面重建评估指标,称为立面特征距离(FFD)。与主要通过像素重叠来评估相似性的 mIoU 或 FRDS 等传统指标不同,FFD 测量从视觉 Transformer 派生的高级特征空间中的距离。在此过程中,它捕获了语义正确性和建筑布局,为立面重建质量提供了更合适的评估。所提出的管道和评估策略共同为语义丰富的 3D 城市模型的自动生成和分析提供了实用且可扩展的贡献。开发的代码发布于:https://github.com/hcu-cml/citydb-SVI2LoD3-ai。