盒监督树冠实例分割的潜在共性期望最大化
Latent Commonality Expectation-Maximisation for Box-supervised Tree Crown Instance Segmentation
摘要
航空图像中的个体树冠分割支持景观尺度的树级碳核算、生物多样性和恢复监测。然而,现有模型主要针对茂密的树冠森林图像进行训练,并在稀树草原和旱地中退化,这些地方的树冠稀疏,外观各异,并且在带注释的基准中代表性不足。这些模型通常还依赖于昂贵的多边形注释。我们引入了 LACE(LAtent Commonality Expectation-maximization),这是一种盒监督实例分割模型,在 0.1 m/px 航空 RGB 树冠图像上进行评估。 LACE 使用冻结的 DINOv3-web ViT-L/16 编码器,应用于四个空间偏移并交织成更密集的特征网格,以及仅在边界框上训练的轻量级 CenterNet 式检测头。我们使用期望最大化来将边界框中反复出现的“树状”与周围环境分开。在 OAM-TCD 基准测试集上,LACE 在 900 张带框注释的图像且没有掩模注释的情况下训练,达到了 $0.663 \pm 0.001$(3 个种子)的掩模 AP$_{50}$,高于 Restor 发布的掩模监督 Mask R-CNN 的 0.626 得分,该算法是在完整的约 4.2k 图像集上训练的。在稀疏冠层保留集上,掩模 AP$_{50}$ 上升至 $0.691$,而 Detectree2(掩模监督基线)的 $0.612$ 则上升至 $0.691$。在 NeonTreeEvaluation 上,使用官方评估代码,仅从 23,424 个手工注释的 RGB 框中,LACE 就达到了 $0.728 \pm 0.003$ F1@0.4(5 个种子),与作者发布的 DeepForest 模型的 0.719 相匹配,使用了不到 0.1% 的训练注释,并且没有使用其 LiDAR 衍生的 30M-crown 预训练集。通过利用冻结的自我监督功能,LACE 可以匹配或超越仅来自盒子的完全监督的专家基线,从而无需在标记数据稀缺的稀疏树冠环境中的树冠实例分割中进行多边形注释。