论文

多模态预测何时得到生物学支持?诊断评估框架

When Are Multimodal Predictions Biologically Supported? A Diagnostic Evaluation Framework

模型评测评测方法与指标

摘要

肿瘤学中的多模态模型可以产生准确的预测,但准确的预测并不能揭示该模型是否学习了跨模态共享的生物学、仅限于一种模态的生物学,或者反映混杂因素而不是真实生物学的虚假相关性。我们引入了 DECAT,这是一个与模型无关的事后评估框架,它使用五个空引用指标和基于规则的决策程序,将多模态表示分为给定任务和模态的四种诊断场景。该框架基于学习到的表示进行操作,不需要知道存在哪些特定的混杂因素,并且当证据不足时返回不确定的结果。我们在四个多模态模型类别(超过 2,500 个经过训练的表示)的合成数据和来自 8,979 名 TCGA 患者的真实数据上验证了 DECAT,评估了多模态嵌入和五个预训练的病理学基础模型。纠缠模型(例如 CLIP)实现了近乎完美的共享生物学检测,但在大多数情况下错误地声称共享生物学,而真正的基础模型嵌入中不存在共享生物学。这种错误声明率随着混杂强度的增加而增加,因此更大的队列和更强的表征会产生更自信但仍然不正确的诊断。应用于多模态 TCGA 嵌入和五种没有配对 RNA 的病理学基础模型,DECAT 可以检测到 AUROC 不可见的混杂因素,而不需要混杂因素标签,正如事后分层所证实的那样。