语义增益从何而来?语义知识驱动长尾对比学习的复现与扩展
Where Does the Semantic Gain Come From? A Reproduction and Extension of Semantic Knowledge-driven Contrastive Learning for Long-Tailed Recognition
摘要
语义知识驱动的对比学习(SKCL)使用语言模型来决定哪些类是相关的,并将每个图像拉向其语义邻居的原型。在 CIFAR-100-LT(beta = 100)上,它报告了 54.02% 的 top-1 准确率,比它所基于的平衡对比学习 (BCL) 方法高出 2.01 个百分点。代码和类描述不公开。我在一个框架中重新实现 SKCL、BCL 和 ConCutMix,根据公共基线代码对其进行检查,并使用三个种子运行每个配置。两条基线的误差在 1.5 点以内,但正如论文所述,建立在 BCL 之上的 SKCL 最终比 BCL 低 0.56 点。为了找出原因,我将 SKCL 添加到作者自己的 ConCutMix 代码中。经过论文 300 个 epoch 的训练,它达到了 53.69,仅比公布的数字低 0.33。然而,在相同的预算下,语义图仅比 ConCutMix 增加了 0.23 个点,而训练 ConCutMix 在 100 个以上的 epoch 上增加了 1.04 个点。再加上 ConCutMix 公布的领先于 BCL (1.15) 的结果,这就解释了所声称的增益。从未见过该图的 BCL 模型已经将图的前 2 个邻居中的 41.2% 与它自己最混乱的类共享(随机水平为 2.0%),这说明了为什么该图在这些基准测试中添加的内容如此之少。我还测试了 SKCL 的一些更改。将其与 CutMix 分支相结合将其改进了 1.06 个点,并且该图的自适应版本对其进行了轻微改进(两个代码库中 +0.34 和 +0.28),尽管这些增益在种子噪声范围内。