论文

有声还是无声?多模态临床AI按模态分析失效的可复用框架

Loud or Silent? A Reusable Framework for Per-Modality Failure Analysis in Multimodal Clinical AI

模型评测评测方法与指标

摘要

多模态临床模型通常根据每种模态的准确度进行评估,但在部署时会去除某些模态。例如,心电图(ECG)通常是常规检查,而超声心动图(Echocardiogram)则可能不可用。除了模态的准确度损失之外,还有两个问题需要考虑:哪个模态是负责的,以及模型在删除该模态后是否表现出明显的错误。这两个问题在每个实例和模态级别上都是不同的,与后验特征解释(例如SHAP)无关。模型经常被替换,因此回答这些问题的答案模型被重复使用。我们提出了一种模型无关的模态失败框架:给定N个模态嵌入,任何模态感知的探针,以及标签,它返回每个实例的失败分类,模态级的互补性矩阵,该矩阵将错误分配给模态,并使用仅基于部署观察信号的大声-无声的dropout分层,以区分可监控的失败和那些在决策边界远去但未被标记的失败。我们将其发布为一个小、单元测试的Harness,并验证其与植入的地面真值相匹配。在不同种子下,它恢复了植入的模态主导和互补子集,报告了每个模态的大声-无声比率,并扩展到一个三模态互补性矩阵;因为植入的结构是构造好的,这验证了对每个实例的解释而不是临床性能的恢复。然后我们实例化该框架用于冻结的EchoJEPA和HuBERT-ECG嵌入,用于LVEF和EF <= 40% HFrEF门限,与配对的MIMIC-IV队列中的对侧测试集(n = 245)一起,删除心电图几乎增加了错误。心电图与ECG之间的狭窄重叠,限制了队列大小,本身就是一个部署发现。我们的所有工作都可以在https://github.com/criticaldata/PRIMED-AI找到。

有声还是无声?多模态临床AI按模态分析失效的可复用框架:论文配图
图2:三模态实例的互补性矩阵:对角线是单一模态的测试 MAE,非对角线是模态两两组合的测试 MAE,数值越低越好。所有包含超声心动图的组合都显著优于心电图加实验室检查,表明超声心动图不可替代。此类非平凡的贡献归因需要至少三种模态(N≥3)。