论文
好、坏和脆弱:组织病理学基础模型的鲁棒性和泛化基准测试
The Good, the Bad, and the Brittle: Benchmarking Robustness and Generalisation of Histopathology Foundation Models
摘要
病理学基础模型的稳健性和通用性如何?是否已达到其扩展极限?我们使用鲁棒性评估和增强工具箱 (REET) 对 12 个病理学基础模型 (PFM) 和 ResNet 基线进行了基准测试,涵盖 11 个临床实际扰动和相异驱动的非冗余 K 倍验证 (NR-Kfold) 协议。我们引入扰动性能指数(PPI)来总结受控扰动扫描下的精度趋势,并通过参数计数分析鲁棒性缩放。我们表明,PFM 在鲁棒性和领域泛化方面始终优于 CNN,但模型缩放显示收益递减:中型模型(例如 UNI2/Virchow-2 等)与大型系统相比,具有可比或更高的弹性。 NR-Kfold 分析进一步揭示了当训练-测试相似性被破坏时系统准确性损失和变异性增加,强调了明确的分布偏移评估的必要性。这些发现表明,下一代病理学基础模型必须优先考虑数据质量、多模态信息和领域对齐而不是参数计数,以实现真正的临床可靠性。