论文
一种面向通俗且经验证的XAI解释的两阶段LLM框架
A Two-Stage LLM Framework for Accessible and Verified XAI Explanations
摘要
大语言模型(LLM)越来越多地被用于将可解释人工智能(XAI)方法的技术输出转化为通俗易懂的自然语言解释。然而,现有方法往往缺乏对准确性、忠实性与完整性的保证。与此同时,当前对这类解释文本的评估大多仍为主观判断或仅限于事后打分,没有提供防止有缺陷的解释到达最终用户的保障机制。针对这些局限,本文提出一个两阶段LLM元验证框架,包含:(i) 将原始XAI输出转化为自然语言叙述的解释LLM,(ii) 从忠实性、连贯性、完整性与幻觉风险方面评估叙述的验证LLM,以及(iii) 利用验证LLM的反馈来细化并改进叙述的迭代回灌机制。在五项XAI技术与数据集上、使用三个开放权重LLM系列的实验表明,验证对于过滤不可靠解释至关重要,同时相比原始XAI输出提升了语言可及性。此外,对细化过程中熵产生率(Entropy Production Rate, EPR)的分析表明,验证LLM的反馈逐步引导解释LLM趋向更稳定、更连贯的推理。总体而言,所提框架为构建更可信、更普惠的XAI系统提供了高效路径。
