论文

SCALE:通过嵌入空间中的协议标签进行综合校准

SCALE: Synthetic Calibration via Agreement Labeling in Embedding Space

模型评测鲁棒性、公平性与可信度评测

摘要

计算病理学的基础模型通常使用 AUC 和准确性进行评估,而校准通常未经测试。这很重要,因为模型平均而言可能是准确的,但仍然会为即使对于病理学家来说也很困难的病例分配过于自信的概率。我们研究八个病理学基础模型的校准。使用病理学家的一致性作为诊断难度的衡量标准,我们发现低一致性病例的校准误差始终高于高一致性病例。仅从总体预期校准误差 (ECE) 来看,这种模式并不明显。然后,我们提出了综合一致性校准,这是一种无需收集多注释器标签即可改进校准的方法。给定经过训练的线性探针,我们选择高置信度嵌入作为类锚点,并在相反类的锚点之间进行插值。插值权重编码了诊断模糊性的连续概念,我们将其用作合成一致性信号,通过一致性感知标签平滑来重新训练探针。在 MHIST(包括七位病理学家的注释)上,合成一致性校准恢复了基于真实病理学家一致性的标签平滑所获得的大部分校准改进,同时相对于未校准的基线大幅减少了低一致性 ECE。保留歧视指标。在 PatchCamelyon 和 BreakHis(没有多注释器标签的公共组织病理学数据集)上,该方法改进了评估基础模型的校准,而如果没有额外的专家注释,则无法使用依赖于注释器的方法。