论文

重新思考冻结视觉基础模型的抗噪声训练:跨数据集基准和小损失失败案例研究

Rethinking Noise-Robust Training for Frozen Vision Foundation Models: A Cross-Dataset Benchmark with a Case Study of Small-Loss Failure

模型评测基准与评测资源

摘要

具有轻量级分类头的 Frozen Vision 基础模型 (VFM) 越来越多地用于医学成像,因为它们提供高效且可重复的部署。然而,对于这种冻结特征机制的噪声标签学习方法仍然知之甚少,并且大多数现有方法仍然依赖于从端到端训练继承的小损失假设。我们提出了跨五个医学数据集、三个主干、两种噪声类型和五种噪声率(150 个条件,6,000 次训练运行)的八种噪声标签方法的受控基准,并以平衡的精度进行了评估。基准测试表明,没有普遍的获胜者:Friedman 对 150 个条件的排名得出 $χ^2 = 333.2$ ($p = 4.77 \times 10^{-68}$),ELR 赢得最多的条件 (49/150),而 CUFIT 获得最佳平均排名 (2.51)。方法选择的实际成本随着噪声严重程度的增加而急剧增加,从干净数据的 4.5pp 到不对称 40\% 噪声的 18.8pp。为了解释这些基准水平模式,我们重新审视代表性高风险制度中的小损失假设。在冻结的 DINOv2 特征下,干净和噪声损失分布重叠 53--61\%,并且匹配率干净样本检测表明,预测一致性明显比非对称噪声下的损失排序更稳定(3pp vs.\ 13pp 精度下降)。在具有不对称 40% 噪声的 ISIC2019 上,协同教学的总体准确率达到 68%,但平衡准确率却下降到 35.1%,三个少数类别的召回率为零。总之,这些结果将冻结 VFM 的噪声标签学习重新定义为一个机制感知的方法选择问题,而不是寻找单一主导算法。我们以基于证据的指导和低遗憾的特征空间选择器作为实际推荐的结论。