论文

上下文归因如何处理模型已经知道的内容

How Context Attribution Handles What the Model Already Knows

模型评测评测方法与指标

摘要

大语言模型 (LLM) 的上下文归因方法可识别哪些输入上下文对模型响应有贡献。最近的工作表明在归因上下文的贡献分数方面取得了初步成功。然而,我们观察到,当上下文与训练数据重叠时,这些方法无法将上下文与权重(IW)贡献分开,从而产生不可靠的分数。基于这一观察,在这项工作中,我们介绍了:1)依赖于四个新指标(基本模型上下文归因得分(BCS)、跨模型上下文归因一致性(CAC)、归因保留得分(APS)、源分离精度(SSP))的评估协议和2)带有真值出处标签的基准数据集(WMDP-Cyber​​++),以系统地评估IW重叠下的归因。在我们对四种著名的上下文归因方法的实验中,我们证明,当来自上下文的知识也存在于权重中时,它们会提供不忠实的归因。最后,我们采用这些方法进行源分离(IW 与上下文学习(ICL)),并表明它们无法根据贡献分数进行解耦