论文

CHARTER:审计病理基础模型紧凑证据评测中的参照替换

CHARTER: Auditing Reference Substitution in Hierarchical Compact-Evidence Evaluation for Computational Pathology

模型评测评测方法与指标

摘要

在数字病理学中,紧凑的证据通常用于解释或审核全幻灯片图像多实例学习模型所做的预测。在分层紧凑证据管道中,候选过滤除了原始的整袋预测之外,还引入了特定于策略的候选条件预测。然而,如果评估参考发生变化,而预期目标仍然是原始的整袋预测,则不仅同一紧凑证据的测量保真度会发生变化,而且竞争候选策略之间的比较也会发生变化。为了明确这种依赖性,我们引入了 CHARTER,这是一种参考感知评估章程,要求研究人员声明预期目标和参考,量化候选引起的预测变化,并审核比较结论的稳定性。在我们主要的五种子 Random-K 审核中的 15 项比较中,4 项显示出确定的逆转;在匹配的本地排名压力测试中,ACMIL 比较从 REVERSED 更改为 PRESERVED。 CHARTER 将隐含的候选过滤和参考选择转变为可审计的评估规范,有助于区分预期预测的真正保留与因改变所解释的预测而引起的明显收益。

CHARTER:审计病理基础模型紧凑证据评测中的参照替换:论文原图
图 3:跨任务、MIL 架构和病理编码器的参考替代效应的广度。更广泛的审计包含 108 个计划任务 MIL 单元中的 70 个经过验证的估计以及 60 个计划编码器单元中的 24 个经过验证的估计。 A,10 个任务 $\times$ 3 MIL 架构(ABMIL、TransMIL 和 ACMIL;30 个单元)的完整公共覆盖子集。 B,所有八个任务 MIL 设置在 UNI2-h 和 Phikon-v2 之间直接匹配(16 个估计值)。 Fill 在共享尺度上对带符号的直接​​成对参考效果 $R=\Delta_{\mathrm{cond}}-\Delta_{\mathrm{orig}}$ 进行编码; R/P 表示反转/保留,没有字母的单元格是排名不确定的。显示的子集是由公共覆盖范围或编码器匹配定义的,而不是由观察到的结果定义的。