论文

图像增强作为基于深度学习的图像检索系统的测试生成

Image Augmentation as Test Generation for Deep Learning-Based Image Retrieval Systems

模型评测鲁棒性、公平性与可信度评测

摘要

确保基于深度学习的图像检索系统的可靠性是软件工程的挑战。本文提出了双重贡献:(1) 对增强和生成技术的文献综述,最终确定了 50 种技术,我们将这些技术组织成十类分类法;(2) 一项大规模的实证研究,评估这些技术作为基于嵌入的图像检索系统的测试生成器。使用 Amazon Titan 和 OpenCLIP 嵌入增强图像,并从四个分析维度进行评估:(1) 嵌入空间相似性,(2) 通过四个估计器测量的嵌入不确定性,(3) 由 LLaVA 评分的语义真实性,以及 (4) 检索失败率。在三个数据集上进行实验:CIFAR-10、ImageNet-1K 和来自工业合作伙伴 (March Networks) 的数据集。在所有评估的数据集和嵌入模型中,以及在每种技术测试的单一严重性级别下,天气模拟和 SaSPA 是图像增强/生成技术,可产生最高的嵌入不确定性和失败率,同时在性能稳定性、视觉真实感和增强有效性之间保持良好的平衡。我们讨论的结果是特定于配置的,并且可能在较温和或较强的扰动设置下发生变化。相比之下,基于 GAN 的增强技术的真实感是最低的,这表明存在合成伪影和感知不一致,从而降低了它们生成真实测试输入的适用性。总的来说,我们的研究结果为选择增强技术提供了实用指南,这些技术可以最大限度地提高测试多样性,同时保留真实的图像特征,从而能够为图像检索系统构建全面有效的测试套件,同时通过使用变质测试来降低手动数据标记的成本。