论文

图像分类模型的反事实压力测试

Counterfactual Stress Testing for Image Classification Models

模型评测鲁棒性、公平性与可信度评测

摘要

由于人口统计、扫描仪硬件或采集协议的分布变化,医学成像中的深度学习模型在部署到新的临床环境中时经常会失败。一个主要挑战是规格不足,具有相似验证性能的模型表现出不同的实际故障模式。尽管压力测试已成为评估这一点的工具,但当前的方法通常依赖于简单的、不知情的扰动(例如亮度或对比度变化),这无法捕获临床上的实际变化,并且可能高估稳健性。在这项工作中,我们引入了一种基于因果生成模型的反事实压力测试框架,该框架通过干预扫描仪类型和记录的性别等属性来创建逼真的“假设”图像,同时在很大程度上保留解剖学身份,从而在目标分布变化下实现受控和语义上有意义的评估。在两种成像方式(胸部 X 射线和乳房 X 光检查)、三种模型架构和多种班次场景中,我们表明,反事实压力测试为真实的分布外性能提供了比经典扰动更准确的代理,捕获性能变化的方向和相对幅度,并显示出更强的总体排名一致性。这些结果表明,因果生成模型可以提供信息丰富的综合压力测试,用于在部署之前评估目标分布变化下的稳健性。