论文

使临床语言模型可审计:概念引导的 微调 用于稳健预测

Making Clinical Language Models Auditable: Concept-Guided Fine-Tuning for Robust Prediction

模型训练监督微调与指令调优

摘要

临床语言模型可以在医院内实现很高的准确性,但在部署转移时会失败,因为它们利用了不反映患者状态的特定于注释的工件(例如模板、分隔符、样板)。我们提出了 CAST(概念引导的伪影抑制调整),这是一种基于 SAE 的可审计临床文本分类框架。 CAST 使用稀疏自动编码器来暴露来自中间 Transformer 激活的稀疏、人类可审计的特征,使用 LLM 辅助解释管道和 ICD-10 检索约束来标记 SAE 潜在特征,通过 微调 期间的残差减法抑制已验证的工件潜在特征,并为审计模型决策提供事后每个概念归因。在 MIMIC-IV 出院单死亡率预测中,CAST 改进了相应的微调编码器基线,并与强大的 LLM 基线保持竞争力,同时生成支持每个预测的临床概念的特征级审计跟踪以及训练期间抑制的伪影概念。