论文
忠实性 血清:通过归因指导缩小 LLM 决策文本解释中的 忠实性 差距
Faithfulness Serum: Mitigating the Faithfulness Gap in Textual Explanations of LLM Decisions via Attribution Guidance
摘要
大语言模型 (LLM) 实现了强大的性能并彻底改变了 NLP,但它们缺乏可解释性,使其被视为黑匣子,限制了它们在需要透明度和信任的领域中的使用。解决这个问题的一个有前途的方向是事后基于文本的解释,其目的是用自然语言解释模型决策。之前的工作重点是生成令人信服的基本原理,这些基本原理似乎在主观上是可信的,但目前尚不清楚这些解释在认识论上是否可信,是否反映了模型实际做出决策所依赖的内部证据。在本文中,我们首先通过反事实评估 LLM 生成的解释的认知 忠实性 并表明它们通常是不忠实的。然后,我们引入了一种 无需训练 方法,该方法通过注意级别干预指导解释生成来增强 忠实性,并通过忠实归因方法提取的 词元级 热图提供信息。该方法显着改进了跨多个模型、基准测试和提示的认知 忠实性。