论文

一种面向通俗且经验证的XAI解释的两阶段LLM框架

A Two-Stage LLM Framework for Accessible and Verified XAI Explanations

模型推理推理验证与自校正

摘要

大语言模型(LLM)越来越多地被用于将可解释人工智能(XAI)方法的技术输出转化为通俗易懂的自然语言解释。然而,现有方法往往缺乏对准确性、忠实性与完整性的保证。与此同时,当前对这类解释文本的评估大多仍为主观判断或仅限于事后打分,没有提供防止有缺陷的解释到达最终用户的保障机制。针对这些局限,本文提出一个两阶段LLM元验证框架,包含:(i) 将原始XAI输出转化为自然语言叙述的解释LLM,(ii) 从忠实性、连贯性、完整性与幻觉风险方面评估叙述的验证LLM,以及(iii) 利用验证LLM的反馈来细化并改进叙述的迭代回灌机制。在五项XAI技术与数据集上、使用三个开放权重LLM系列的实验表明,验证对于过滤不可靠解释至关重要,同时相比原始XAI输出提升了语言可及性。此外,对细化过程中熵产生率(Entropy Production Rate, EPR)的分析表明,验证LLM的反馈逐步引导解释LLM趋向更稳定、更连贯的推理。总体而言,所提框架为构建更可信、更普惠的XAI系统提供了高效路径。

一种面向通俗且经验证的XAI解释的两阶段LLM框架:论文配图
图 1:拟议的两阶段 LLM 元验证框架概述。第 1 阶段(解释器)根据 XAI 输出生成自然语言解释,而第 2 阶段(验证器)评估解释并发布接受-拒绝判决;被拒绝的解释通过重新反馈机制进行完善。