论文

用于边缘洪水分割的跨架构基础模型蒸馏

Cross-Architecture Foundation-Model Distillation for Edge Flood Segmentation

摘要

地理空间基础模型可以提供强大的洪水分割性能,但其大小限制了在内存受限的边缘硬件上的部署。我们将 3 亿参数的 Prithvi-EO-2.0 教师(在 252 个手动标记的 Sen1Floods11 训练场景上进行微调)提炼为 70 万参数的 EfficientViT-B0 学生。教师监督其他未标记的 Sentinel-2 图像,允许学生训练集增长,而无需新的手动注释。在 252 个场景的匹配预算下,教师监督的训练与直接训练相比具有竞争力,并提高了测试配置中的 STURM-Flood 性能;几何匹配的控件显示标签源本身并不能解释差异。将教师监督的池扩展到 2,500 个场景可以缩小剩余的学生与教师差距:在 Sen1Floods11 测试分割中,漂浮学生达到 0.787 的水交集,而教师为 0.822,在我们的评估协议下与 STURM-Flood 上的教师相匹配,并在 WorldFloods-v2 上保持低于该水平。经过激活替换和量化感知训练后,学生在 Jetson Xavier NX 上作为 1.5 MB 8 位整数 (INT8) TensorRT 引擎运行,每个 512 x 512 图像的图形处理单元 (GPU) 计算时间为 5.57 毫秒,运行时设备内存约为 14 MB。固定的修正归一化差异水指数(MNDWI)阈值在两个干净的外部基准上与两个模型都具有竞争力,因此我们将这些基准解释为泛化测试,而不是作为学习模型优于谱规则的证据。结果支持以下结论:基础模型监督可以将固定的手动注释预算放大为更大的训练集,并产生紧凑的、可部署的边缘模型。