检测重要缺陷:制造和零售物流中异常检测的应用程序驱动基准(VAND 4.0 挑战)
Detecting Defects that Matter: An Application-Driven Benchmark for Anomaly Detection in Manufacturing and Retail Logistics (VAND 4.0 Challenge)
摘要
现有的异常检测基准已经饱和并且通常不切实际。作为 VAND 4.0 挑战赛的一部分,我们在工业制造和零售物流这两个部署关键领域引入了隐藏测试、应用程序驱动的基准。在工业赛道 (MVTec AD 2) 中,结果表明无监督异常分割仍然具有挑战性:最好的正则设置方法仅达到约 57% 的像素级 $SegF_1$,这表明还有很大的改进空间。零样本方法落后了约 15 个 $SegF_1$ 点,证实了正常数据上的特定于任务的训练对于精确的缺陷定位仍然至关重要。对分布变化的鲁棒性仍然是一个关键的开放挑战,DINOv3-骨干模型显然在这条赛道上占据主导地位。在零售赛道 (Kaputt 2) 中,结果表明 (1) 常见缺陷类型的监督缺陷检测已接近饱和; (2) 最好的现成VLM方法比专用模型落后约 28 AP,证实目前VLM无法取代微调探测器,(3) 参考图像并没有证明对性能最佳的方法有帮助。性能会因罕见缺陷(溢出约 53 个 AP,缺失单元约 27 个 AP)而崩溃,其中监督上限受到数据可用性的限制。为了推动该领域的未来进步,我们提供了一个新的低流行性零售 AD 数据集 (Kaputt-Rare)。在这两个方面,计算效率被评估为结合性能、吞吐量、记忆和功耗的一流指标。我们引入了一种新的衡量效率的指标,并揭示了性能最佳的方法依赖于重型架构,而效率在很大程度上被忽视。总的来说,我们得出的结论是,社区需要(a)更加注重效率的方法开发,以及(b)针对罕见缺陷和变化条件的真正异常检测方法。 https://sites.google.com/view/vand4-cvpr2026/challenge
