论文
InstructMixup:用于强大数据增强的指令引导显着补丁编辑
InstructMixup: Instruction-Guided Salient Patch Editing for Robust Data Augmentation
摘要
在图像和视频技术中,数据增强被广泛用于提高深度视觉模型的泛化能力,并且在样本之间进行插值的基于混合的策略已成为主导方法。然而,计算信息丰富的混合区域会增加大量开销,并且跨不同图像混合内容经常会破坏所得样本的语义完整性。我们提出了 \our{},一种数据增强方法,可以完全在单个视觉样本中构建具有挑战性但标签一致的训练样本。我们的{}首先使用轻量级显着性检测器从样本中提取多尺度显着性补丁,使用指令引导的生成模型细化每个补丁,并将编辑后的补丁混合回同一样本的非显着性区域;由于生成编辑只计算一次并离线缓存,因此此步骤增加的训练成本可以忽略不计。为了进一步使学习到的表示多样化,\our{}以自适应比例将自相似分形结构注入相同的显着区域,因此每个训练样本都带有分形和非分形结构。我们得出了所产生的邻近风险的二阶近似,表明该方法同时强制生成编辑的不变性并抑制沿扰动显着方向的曲率,并且我们根据经验验证了这两个预测。我们对从小到大的骨干网络(CNN)、视觉 Transformer(ViTs)和视觉语言基础模型(VLM)等七个基准进行评估,涵盖粗粒度和细粒度分类、对损坏和遮挡的鲁棒性、校准、迁移和自监督学习,InstructMixup 优于九种竞争增强方法,超越了所有基准中最强的基准。