鸟类物种识别需要什么输入分辨率,以及边缘设备上的延迟成本是多少?通过设备上测量对 14 种输入分辨率和六种架构进行研究
What Input Resolution Is Required for Bird Species Identification, and What Is Its Latency Cost on an Edge Device? A Study of 14 Input Resolutions and Six Architectures with On-Device Measurements
摘要
风电场的鸟击缓解措施需要识别距离仅数十个像素的远处鸟类,因此分类器的输入分辨率 N 是一个设计变量,而不是固定规格。我们使用超过 14 个边长 N(16 到 224)的因子设计、六种架构、两种训练和评估机制以及 30 个随机种子(2,520 个检查点和 5,040 个评估)以及在 NVIDIA Jetson Orin Nano 上测量的延迟来研究它。四个结果。 (1) 所选的 N 取决于目标:在 N=112 时,ResNet50 在估计 1.85 毫秒内验证达到 0.90(测试时为 0.8980);在 N=144 时,DINOv2-L 在 12.70 毫秒内验证达到 0.95;改变模型比提高 N 能获得更高的准确度(N=112 时+5.93 点,而 N=112 时+2.33 点)。 (2) 降低 N 的好处取决于假设的预处理路径:当每个个体从自己的文件解码时,N=224 -> 80 节省 13.5%,但当检测器解码 4K 帧一次时,节省 46.2%; Pareto 集从 20 种配置增加到 23 种配置。 (3) 必须在已部署的引擎上测量准确度:在 N>=96 时,半精度仅花费 ViT-S/16 4 到 7 个点,而 CNN 保持在 0.1 个点以内,并且在验证时进行选择,176 个目标中的 26 个目标的选择不同。损坏的 FP16 引擎可能比正确的引擎运行得更快,并且无法通过延迟来检测;允许 14 ViT-S/16 FP32 配置将建议移至 0.931-0.938 频段并低于 10 ms 预算。 (4) ViT-L尺度模型适合该设备,但激活超出了FP16范围;在Transformer块边界处分割图表将 FP32 限制在受影响的段,使得部署的 DINOv2-L 链比单引擎构建快 1.85 倍。我们还量化了政权差异符号如何随着种子数量的变化而稳定;删除某些形式的组共享的敏感性分裂保留了选择边界处的所有 14 个重要标志。