论文
零样本医学摘要分类中 DeBERTa-v3 的比较可解释性框架
A Comparative Explainability Framework for DeBERTa-v3 in Zero-Shot Medical Abstract Classification
摘要
提出了一个比较可解释性框架,用于在医学摘要的零样本分类下审核 DeBERTa-v3。 该研究处理可解释人工智能中的解释不一致问题,即不同归因方法对相同输入与预测给出不同解释。研究在Medical Abstracts语料上实现自然语言推断引擎,为每个诊断类别设计五个丰富假设,并每类平衡抽取1000篇文本。比较五种解释方法:不依赖特定模型的SHAP、LIME,面向深度学习的遮挡与Input x Gradient,以及面向Transformer的Attention x Gradient。通过顶级标记归因来标准化解释,并使用 Jaccard 指数来量化成对一致性。在明确定义的临床领域中可以实现高预测准确性,而在高度语义模糊性下性能会下降。 解释稳定性直接对应预测确定性:含义明确的类别表现出较强一致性,诊断不确定时明显下降。定性错误审计还发现三类系统性失败机制:词汇过度敏感、语义重叠和归因一致性丧失。结果支持在医学文本分类中审计Transformer模型时联合使用多种解释方法与定量一致性指标,并优先采用具体临床本体而非宽泛诊断标签。