论文

LLM 反事实链和因果图的可解释性

LLM Explainability with Counterfactual Chains and Causal Graphs

模型评测模型行为与机制分析

摘要

因果图提供了一种使机制透明的高级语言。最近的工作使用 大语言模型 (LLM) 来恢复外部世界过程的因果图。相反,在本文中,我们使用因果图对 LLM 推理本身进行建模,为利益相关者提供模型如何感知和组织高级概念以产生预测的透明视图。我们提出了一种构建此类图的四阶段方法。给定目标 LLM 和一组文本示例,我们的方法会发现类别区分的、人类可解释的概念,并将每个输入映射到 LLM 感知的概念状态。然后,我们引入了一种受 MCMC 启发的反事实增强程序,该程序通过反事实链扩展稀疏观测数据。这使得能够使用 $σ$-CG 进行稳定的因果发现,从而产生信息丰富、可解释的图表。我们将我们的方法应用于疾病诊断、情感分析和 LLM 作为法官分类任务的三个 LLM。我们评估学习图的预测保真度和结构稳定性,以及 MCMC 启发的收敛性和下游效用增强。我们的结果表明,发现的因果图捕获了与 LLM 推理一致的有意义的依赖关系。总之,本文为 LLM 的概念级可解释性提供了基础。