论文

您可以信任采集转变下的冷冻血液学基础模型吗?

Can You Trust Frozen Hematology Foundation Models under Acquisition Shift?

模型评测鲁棒性、公平性与可信度评测

摘要

冷冻血液学基础模型 (FM) 嵌入可达到接近饱和的域内白细胞 (WBC) 准确性,但临床部署需要跨扫描仪、位点、染色剂和制备管道的可靠性。我们沿着两个轴审核四个公共单细胞采集领域的 15 个冷冻编码器(血液学、病理学和一般视觉):准确性、鲁棒性和校准。域内线性探针宏 F1 已饱和 (0.98-0.997),但跨数据集宏 F1 下降了 34-72%,并且排名重新排序:域内最佳的 DinoBloom-L 在基准共享 224 像素输入的最移位目标 (MLL23) 上跌至第 10 位,落后于 RedDino 和几个通用和病理编码器。排名转移取决于探针:平均而言,1-NN 检索比源拟合线性头更稳定(中位数 $ρ$ 0.65 与 0.45),但这两种探针都不能普遍预测目标鲁棒性。校准也崩溃了:源训练的探针几乎在域内校准(预期校准误差,ECE,0.004),但在域外肯定是错误的(ECE 0.35),并且源拟合的温度缩放传递很差。我们进一步审核预训练暴露并将 MLL23 确定为 DinoBloom 的内部队列;因为 DinoBloom 唯一保留的数据集也是我们的源域,所以该基准无法将曝光与扫描仪相关的偏移隔离开来。无标签适应和基于边际熵的模型选择在平衡评估下似乎是安全的,但在现实的 WBC 类别优先转移下却失败了。类平衡重新标准化 (CBR) 是一种 无需训练 伪标签平衡特征标准化,改进了所有评估的目标先验场景方法,并部分改进了校准,尽管编码器级异常和残留误校准仍然存在。因此,血液学 FM 基准必须联合审核准确性、校准、暴露和类先验稳健性。