临床序列模型表示的稀疏自编码器分解:特征复杂性、任务专业化和死亡率预测
Sparse Autoencoder Decomposition of Clinical Sequence Model Representations: Feature Complexity, Task Specialisation, and Mortality Prediction
摘要
稀疏自动编码器 (SAE) 已应用于 大语言模型 和蛋白质语言模型,但尚未系统地应用于电子健康记录 (EHR) 基础模型。我们在 INSPECT(门诊)和 MIMIC-IV(ICU)的所有 10 个残余流提取点上使用 FlatASCEND(一种 1450 万参数的自回归临床序列模型)训练 TopK SAE。 SAE 分解揭示了 Transformer 深度的渐进抽象:第 0 层特征是近乎完美的标记检测器(45.7% 单例),而第 6 层特征跨越多个临床类别的大约 30 个标记类型(0.5% 单例)。在全序列简单线性探针下,SAE 特征在离散事件预测(死亡率)方面优于密集表示,而密集表示在连续幅度预测(停留时间)方面优于密集表示 - 一种探针级代表性现象,不会扩展到临床相关的泄漏安全窗口,其中密集表示在所有测试设置中匹配或超过 SAE 特征(eICU-CRD 48 小时 AUC:SAE 0.871 与密集 0.880;基本模型零样本, SAE 词典针对 eICU 激活进行了训练;MIMIC-IV:0.836 与 0.914;INSPECT 1 年/3 年:0.697 与 0.800)。 Delta 模式干预方法将 SAE 扰动噪声降低了 86 倍,从而实现了更清晰的特征级实验,尽管在 4 种条件中的 3 种中产生的扰动效应大于随机对照,但在形式上并不显着。随机种子的特征再现率为 21%,各个特征应被解释为说明性的而不是稳定的。