论文

质量无用:LLM 生成的 XAI 叙述作为信任启发而不是决策辅助

Quality Without Usefulness: LLM-Generated XAI Narratives as Trust Heuristics Rather Than Decision Aids

模型评测评测方法与指标

摘要

先前的工作表明,大语言模型 (LLM) 可以将可解释的人工智能 (XAI) 输出转换为自然语言解释 (NLE),该解释在合理性、连贯性和可理解性等质量指标上得分很高。但解释的质量能否转化为实际用途呢?我们通过五个受控实验(在 60 个测试实例中进行 2,730 个判断)在时间序列能源预测领域研究这个问题,每个实验都对 XAI 文献中研究的有用性的不同方面进行了操作。将 NLE 质量保持在先前因子研究建立的高水平,我们发现 NLE 不会提高五项任务中任何一项的任务准确性,同时会夸大自我报告的信心。安慰剂对照表明,这种信心的提升是由文本存在而不是内容驱动的。在分布外检测任务中,NLE 降低了 LLM 判断标记不可靠预测的能力,提供了掩盖模型故障的虚假保证。我们将这些发现描述为质量-有用性差距,并认为对 XAI 到 NLE 管道的评估必须超越文本质量指标,扩展到下游任务性能。