论文

利用 MLLM 进行遥感城市布局提取

Remote-Sensing City Layout Extraction with MLLM

应用与实践视觉感知与空间理解

摘要

遥感系统通常使用检测框、语义掩模或矢量边界来描述城市内容。此类输出定位类并支持图像平面评分,但它们本身并不构成保留对象身份、类型关系、拓扑和再生规则的可执行布局。相反,Code-as-City 将从单个自上而下的图像中提取城市布局,作为使用多模态 大语言模型 (MLLM) 的约束代码生成。图像模型首先产生对齐的五类语义布局先验。三个有序的 MLLM 通行证使用该图像,并在此之前恢复道路​​、土地覆盖区域和关系以及建筑物。确定性标准化将累积的记录转换为城市图和受限布局程序。执行该程序会创建可渲染的 3D 城市布局和共享几何体上的正交语义投影。该投影允许与遥感掩模进行像素级比较,同时命名对象、关系和编辑操作仍然可用于两个视图的同步再生。在 CityLayout-100 的 100 个场景上进行评估,完整的框架获得了 41.1% 的平均交集比和 48.3% 的全局交集比。这一结果提供了定量证据,表明视觉观察可以通过耦合平面和 3D 输出转化为可检查、可编辑的城市代码。