论文
LLM 所解释的并不是他们所相信的:Evaluatingterpretation Sufficient under models' own inputbeliefs
What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs
摘要
大语言模型 (LLM) 越来越多地部署在高风险领域,其中使用自由文本解释(例如思想链和事后理由)来证明模型输出的合理性。然而,目前尚不清楚这些解释是否充分,即它们是否包含足够的信息来解释模型的输出生成过程。我们将经典充分性从特征归因推广到任意解释,并证明解释充分性可以根据输入分布而变化,必须为 LLM 解释明确定义输入分布。我们建议使用 LLM 本身来生成以解释为条件的替代输入,捕获其对可能输入的信念。我们将自洽充分性形式化为自由文本解释的目标,并引入了信息论度量 SCSuff,它可以在不依赖预定义偏差或捷径的情况下评估自由文本解释。我们的实验表明,SCSuff 与适用的目标扰动测试一致,并证明解释充分性可能随输入分布而变化。我们发现 LLM 的解释通常是不充分的,并且与模型大小、准确性或输出熵的相关性较弱。对最终词元隐藏状态的分析表明,可以根据内部表示来预测顶部和底部 SCSuff 分数,这表明 SCSuff 可以指导检测和改进足够的 LLM 解释。本文的代码可在 https://github.com/rajesh-lab/self-consistent-sufficiency 获取。