论文
从理论到决策规则:跨三个医学成像基准校准视觉语言模型弱监督的噪声标签交叉
From Theory to Decision Rule: Calibrating the Noisy-Label Crossover for Vision-Language Model Weak Supervision Across Three Medical-Imaging Benchmarks
摘要
经典的噪声标签理论预测,弱监督下的下游性能受到贴标机准确性的限制,这意味着尖锐的交叉:一旦经过黄金训练的分类器与贴标机匹配,弱标签就不再提供帮助并开始造成伤害。该预测是理论上的;缺少的是基准校准,将其转变为现代基础模型贴标机的实例级声明。我们在三个医学成像基准(PCAM、ISIC、NIH-CXR)和跨越 11 倍参数范围的六个下游架构上为 BiomedCLIP 生成的弱标签提供此类校准。理论预测的交叉在PCAM上出现在ng~100,在ISIC上出现在20-50,在NIH-CXR上出现在250-500;交叉点以上的弱标签会使 AUC 降低高达 -0.10。对于五个预训练架构中的四个来说,位置是架构不变的,并且家庭内 DenseNet 扫描(2.5 倍参数,相同的预训练)支持这样的观点:标记者(而不是学生)是主要约束。校准反过来会产生可操作 10-20 个黄金标签的决策规则:比较用户黄金组上的纯黄金 AUC 与 VLM 精度。 NIH-CXR 上的结构化与随机噪声符号翻转表明,仅速率的界限公式是不完整的,并确定了未来基准测试可以设计测试的具体改进(标签空间投影)。