论文
用句子级能量景观解释黑盒LLM
Interpreting Black-Box Large Language Models with Sentence-Level Energy Landscapes
摘要
大规模语言模型(LLMs)的广泛采用,仅通过封闭API访问,导致了负责任部署中的一个关键挑战:缺乏解释性。为了解决这个问题,我们提出了一种模型-agnostic、事后解释器,其作用于句子级别。我们的方法训练一种能量基础模型(EBM)作为代理,以捕捉提示和响应之间的LLM内部概念一致性。这个能量图谱引导轻量级解释器网络的训练。独特的是,我们的解释器作为一个独立工具运行;一旦训练完成,它将用户指定的目标输出的影响量化,而无需进一步查询到LLM的API。通过全局训练一个本地解释器,跨多种输入,我们捕捉更广泛的生成模式,并缓解实例特定偏见。实验结果表明,我们的EBM准确模拟目标LLM,使解释器能够有效地识别生成特定目标输出中最影响的提示句子。