论文
大语言模型反事实自我解释的实证研究
An Empirical Study of Counterfactual Self-Explanations in LLMs
摘要
大型语言模型可以轻松地为自己的输出生成解释,但这种自我解释不一定忠实于模型的行为。我们通过反事实的自我解释来研究这个问题,其中模型最少地编辑输入,以便其自身的预测发生变化。通过情感分析和自然语言推理,我们评估了来自 LLaMA-3 和 Qwen-2.5 系列的 10 个指令调整模型,衡量忠实性、极简性以及与人类注释原理的一致性。我们的结果表明,模型规模是解释质量的最强决定因素:较大的模型更有可能产生反事实,从而翻转自己的预测和目标决策相关证据。相比之下,以基本原理为导向的条件会产生最少编辑的反事实,而且也更符合人类的需求。然而,它并不能持续提高忠诚度。总体而言,反事实的自我解释可以提供有关模型决策的有用的行为证据,但其可靠性在很大程度上取决于模型的能力,应该根据经验进行验证而不是假设。