论文

ConceptSMILE:审核基于概念的可解释人工智能的可信度

ConceptSMILE: Auditing the Trustworthiness of Concept-Based Explainable AI

模型评测评测方法与指标

摘要

基于概念的可解释人工智能 (AI) 可以使模型推理更容易被人类理解,但概念级输出并不自动值得信赖。我们引入了 ConceptSMILE,这是一种与模型无关的基于扰动的审核框架,用于评估基于概念的解释的可靠性。 ConceptSMILE 没有取代 SMILE,而是将其基于扰动的逻辑从特征或区域级别的归因扩展到人类可理解的概念解释的审核。该框架扰乱输入区域,测量概念响应变化,应用局部加权,并拟合 XGBoost 代理以近似局部概念行为。可靠性通过归因准确性、替代保真度、忠实性、稳定性和一致性来评估。我们通过比较 MedSAM 派生的视觉概念与基于 VLM 的语义概念来评估视网膜眼底图像上的 ConceptSMILE。结果表明,不同概念和途径的可靠性各不相同:MedSAM 实现了更强的空间归因和最高的替代保真度($R^2 = 0.8503$、$R_w^2 = 0.8465$),而 VLM 途径在选定的人工制品条件下显示出更强的血管 忠实性 和更强的稳定性。 ConceptSMILE 提供了一个独立的审核层来评估基于概念的 XAI 的可信度。