论文
基于嵌入的异常检测,用于清理全球作物类型参考数据集
Embeddings based Anomaly Detection for Cleaning Global Crop Type Reference Datasets
摘要
高质量参考数据仍然是任何空间和时间尺度上作物类型绘图的关键瓶颈。 WorldCereal 等操作系统聚合了来自不同来源的标签,例如包裹登记册、国家数据库、实地调查和地图衍生产品,每个标签都有自己的偏差、覆盖范围差距和未知的标签噪音。简单的全球规则是不够的,因为作物物候和观测条件在不同地区和季节之间差异很大。在本研究中,我们关注一个与操作相关的问题:通过地理空间基础模型生成的嵌入是否是清理参考数据的可行基础。我们提出了一种实用的、局部感知的、基于嵌入的异常(EBA)检测框架,该框架在预训练的地球观测编码器的嵌入上运行。我们使用预训练嵌入对同一区域中同一作物的其他样本对每个标记样本进行评分,标记突出的样本,并测试在训练之前是否删除或降低它们的权重以产生更好的模型。我们确定标记点确实以两种独立的方式被错误标记或放错位置:针对合成的 真值,检测器将注入的标记错误集中在其标记集中的机会之上 2.5-5 倍(检测 AUROC 高达 0.84);在真实数据上,独立于模型的测试表明,删除或对标记的保留点进行置信加权可以提高训练模型中作物类型和土地覆盖的测量准确性。然后根据标志采取行动,改进五个宏观区域的 WorldCereal 作物类型模型,并在三个视图下的固定保留分割上进行评估。我们发现保守清洁有帮助,而过度清洁则有害。 EBA 检测器方法被设计为可重复和可扩展,并且可以作为清理作物制图之外的大型、嘈杂的地球观测参考数据集的模板。