论文

可控扰动下可解释模式识别中理据稳定性的实证刻画

Empirical Characterization of Rationale Stability Under Controlled Perturbations for Explainable Pattern Recognition

模型评测评测方法与指标

摘要

可靠的模式识别系统应在相似输入上表现出一致的行为,其解释也应保持稳定。然而,大多数可解释AI(XAI)评估仍以单个实例为中心,未显式量化归因模式在共享同一类别或表示同一输入微小变化的样本之间是否一致。在本工作中,我们提出一种旨在评估模型解释一致性的新指标,确保模型一致地反映预期目标,并在保持标签的扰动下保持一致性。我们在SST-2情感分析数据集上使用预训练BERT模型实现该指标,并在RoBERTa、DistilBERT与IMDB上进行额外的鲁棒性测试,应用SHAP计算各测试样本的特征重要性。所提指标量化同标签输入的SHAP值余弦相似度,旨在检测不一致行为,例如对某些特征的偏倚依赖,或无法为相似预测保持一致推理。通过一系列实验,我们评估了该指标识别错位预测与模型解释不一致性的能力。这些实验与标准忠实度指标进行对比,以评估新指标能否有效识别模型行为何时偏离其预期目标。所提框架通过支持对理据稳定性更稳健的验证,为理解模型行为提供了更深入的视角,这对构建可信赖AI系统至关重要。通过量化模型是否对相似输入依赖一致的归因模式,所提方法支持在实际模式识别流程中对模型行为进行更稳健的评估。我们的代码已在 https://github.com/anmspro/ESS-XAI-Stability 公开。

可控扰动下可解释模式识别中理据稳定性的实证刻画:论文配图
图1:理由稳定性评估总体流程:样本经编码送入transformer分类器,计算事后词元归因,最终得到ESS Score。