论文
语言模型作为特定任务的知识库:可解释性分析
LMs as Task-Specific Knowledge Bases: An Interpretability Analysis
摘要
语言模型(LM)捕获大量适用于各种任务的事实知识,激发了将其参数视为知识库的观点。知识库的一个重要特性是,利用单一事实来源,对同一事实的不同查询会返回一致的结果。我们通过行为和机制分析来研究 LM 是否满足此属性。我们的结果表明它们以特定于任务的方式编码知识。从行为上来说,在一项任务中获得的事实在训练过程中经常无法在其他任务中同时出现。参数定位实验提出了一种机械解释,揭示了同一事实的不同任务背后的不同参数子集。最后,我们表明,思想链推理的部分有效性来自于与评估任务相关的特定任务参数。我们的研究结果表明,模型知道什么以及如何询问它在参数空间中交织在一起,破坏了“知识库”类比,并对语言模型中事实知识的可靠性和可控性产生影响。