论文

卫星能看到通勤者吗?视觉基础模型的关键基准

Do Satellites See Commuters? A Critical Benchmark of Vision Foundation Models

模型评测鲁棒性、公平性与可信度评测

摘要

卫星基础模型为生成通勤出发地-目的地 (OD) 提供了全球可用的人口普查数据替代方案,但尚无研究系统地比较单个下游管道中的编码器范例。我们在相同的 WeDAN 图扩散框架内消除了四种卫星视觉编码器:语言监督 (RemoteCLIP)、自我监督 (DINOv3) 和与地理信息对齐 (SatCLIP、AlphaEarth),覆盖 1,925 个美国县、325 个英国地区和 14 个全球城市,采用五个随机种子。出现了三个主要发现。首先,语言监督功能实现了最强的分布内性能(RemoteCLIP CPC 0.602),而与地理信息对齐编码器可以更可靠地进行零样本传输:AlphaEarth 在英国地区的 CPC 比 RemoteCLIP 提高了 33%。其次,仅预训练语料库规模是不够的:DINOv3 在更大的卫星语料库上进行训练,其 CPC 分布比 RemoteCLIP 低 0.091,并且全局 CPC 下降至 0.022。第三,没有编码器有效地传输到全球城市(RemoteCLIP 的最佳 CPC 0.122,DINOv3 的 0.022),确认跨大陆 OD 生成仍然是一个悬而未决的问题。我们还澄清了人口普查噪声参数 $η$ 的语义,其顺序在跨大陆评估下颠倒,这是正确解释先前结果的关键区别。训练脚本和评估日志将被发布。