论文

计算病理学中测试时间适应的解释稳定性:大规模基准

Explanation Stability of Test-Time Adaptation in Computational Pathology: A Large-Scale Benchmark

模型评测鲁棒性、公平性与可信度评测

摘要

测试时间适应 (TTA) 已成为使部署的模型适应未标记的目标数据的实用方法,这种设置在计算病理学中特别相关,在计算病理学中,染色、扫描仪和队列转移是常规的。虽然大多数 TTA 方法都是通过其对准确性的影响来评估的,但临床使用还取决于模型的解释在适应后是否仍然可靠。在本文中,我们仔细研究了这种很大程度上未测量的影响。我们使用从卷积网络到视觉 Transformer 的五种架构和病理学基础模型、十七种 TTA 方法和四个归因系列,研究了两个组织病理学基准 Camelyon17 和 NCT CRC-HE 下 TTA 的解释稳定性。在 2,958 次适应运行中,我们观察到一个清晰且系统的模式:TTA 方法在移动模型解释的程度方面存在显着差异,冻结骨干方法使归因几乎不变,而 CoTTA 和 RoTTA 等连续方法造成最大的漂移。这种效果并不均匀。卷积网络比 Transformer 和基础模型主干更加敏感,并且解释漂移随着适应强度的增加而增加,同时对批量大小基本上不敏感。令人惊讶的是,解释稳定性与适应质量仅弱耦合。一些方法几乎完美地保留了解释,同时降低了校准或准确性,产生了无声的故障,而这些故障可能会被仅准确度或仅解释的评估所错过。这些发现表明,解释稳定性是计算病理学中 TTA 的一个独特的可靠性轴。我们发布指标、协议和完整基准,以支持未来的适应方法工作,这些方法不仅准确,而且稳定且可进行临床审核。代码:https://github.com/bahumanyarg11/tta-explanation-stability-pipeline