论文

XAI-Arena:LLM能评价可解释性方法的解释质量吗

XAI-Arena: Can LLMs Assess the Quality of XAI Explanations?

模型评测评测方法与指标

摘要

评估可解释人工智能(XAI)方法产生的解释的质量仍然具有挑战性,因为现有方法通常依赖于人类的主观判断,限制了研究之间的可重复性、可扩展性和可比性。我们研究大语言模型是否可以作为一种可重复和可扩展的机制来对 XAI 解释的质量进行比较评估。我们引入了 XAI-Arena,这是一个大语言模型作为法官的框架,用于对 XAI 解释质量进行可扩展、可重复、多维和利益相关者敏感的评估。然后,XAI-Arena 允许我们从各个维度比较 XAI 解释,即感知的简单性、清晰度、任务充分性、信任校准、可操作性、透明度、忠实性和整体可解释性。然后,我们跨各种数据集、机器学习模型和利益相关者角色对 XAI 解释方法进行基准。人类验证显示 LLM 生成的评分与人类评分之间存在很强的正相关性(Spearman's rho=.693,p<.001)。总之,基于 LLM 的评估可以捕捉 XAI 解释质量的系统差异,并为 XAI 解释的比较评估提供可扩展和可重复的框架。