论文
ECG-InterpBench:使用匹配规模稀疏自动编码器对 ECG 基础模型的可解释性进行基准测试
ECG-InterpBench: Benchmarking the Interpretability of ECG Foundation Models with Matched-Scale Sparse Autoencoders
摘要
心电图基础模型的现有基准主要评估下游预测性能,对于其内部表示是否可以忠实地分解、临床解释或在独立分析中再现提供了有限的见解。我们引入了 ECG-InterpBench,这是一个旨在系统评估 ECG 基础模型表示的可解释性的基准。 ECG-InterpBench 使用稀疏自动编码器作为标准化测量仪器,并在模型之间匹配其容量以实现受控比较。我们评估了跨五个标准化编码器深度、五个匹配字典宽度和三个随机种子的六个冻结心电图基础模型,生成了一个 450 个单元的可解释性图集,其中包含 75 个完全匹配的六模型比较块。该基准评估了表示可解释性的互补维度,包括稀疏重建保真度、单特征可访问性和 49 个有临床意义的心电图测量的覆盖范围,以及跨种子特征再现性。该评估进一步量化了患者采样的不确定性、深度和种子相关的变化以及对稀疏参数化的敏感性。该基准显示心电图基础模型表现出独特的可解释性特征。 MIMIC-IV-ECG 上的匹配复制证实了重建保真度和临床可及性识别了不同的主要模型。该基准伴随着可执行的评估代码、标准化清单、单元级指标和再现性审核。 ECG-InterpBench 通过提供容量控制和可重复的框架来补充以性能为中心的 ECG 基准,用于在不同的表示可解释性维度上比较 ECG 基础模型。