论文

超越平衡精度:无人机电力线路检测中视觉语言和仅视觉缺陷评估的分辨率和奇偶校验控制基准

Beyond Balanced Accuracy: A Resolution and Parity-Controlled Benchmark for Vision-Language and Vision-Only Defect Assessment in UAV Power-Line Inspection

模型评测评测方法与指标

摘要

据报道,在无人机 (UAV) 电力线缺陷评估方面,视觉语言模型 (VLM) 的性能通常优于特定任务的视觉主干。我们在 ElecVQA-Bench 上测试了这一说法,ElecVQA-Bench 是一个源自公共 InsPLAD 数据集的 56,972 项基准,涵盖六个评估选项:分区、评估项集、标签空间、复制、输入分辨率和辅助信息。在匹配的分区上,Swin Transformer 和最强适配的 VLM 在二进制筛选中仅相差 0.03 个点。在七向缺陷分型中,将视觉主干从 224 像素增加到 VLM 预处理器的测量像素预算,可以将与 InternVL3.5-8B 的差距从 ResNet-50 的 +20.53 点缩小到 -0.57 点,将 Swin-T 的差距从 +23.67 点缩小到 +4.70 点。像素预算审核将 Qwen3-VL-8B 宏召回率提高了 10.78 个点,但源像素匹配的 InternVL 控制仍然使 Qwen 领先 7.43 到 13.61 个点,同时使用的视觉标记减少了 56%,因此源像素和标记预算都无法解释两个 VLM 之间的差异。两种子全局复制将 Qwen 二进制精度和七路宏召回率分别提高了 0.86 和 1.02 个点。经过特定分割的再训练后,Qwen 在作物或图像级别上并不领先,并且 14 塔、三种子复制反转了种子之间的符号,使 Qwen 的平均常见六宏召回率为 0.9085,而 ResNet-50 为 0.9509。没有一种分裂制度能够产生经得起多重比较校正的家族层面的优势。该研究支持基准审计的贡献,而不是 VLM 优越性的一般主张。