论文

在 大语言模型 中跟踪关系知识回忆

Tracing Relational Knowledge Recall in Large Language Models

模型评测模型行为与机制分析

摘要

我们研究 大语言模型 在文本生成过程中如何回忆关系知识,重点是通过线性探针识别适合关系分类的潜在表示。先前的工作展示了注意力头和 MLP 如何相互作用来解析主语、谓语和宾语,但仍不清楚哪些表示支持忠实的线性关系分类,以及为什么某些关系类型比其他关系类型更容易线性捕获。我们系统地评估了从注意力头和 MLP 贡献中得出的不同潜在表示,表明每个头注意力对残差流的贡献是线性关系分类的相对较强的特征。经过训练的探针的特征归因分析以及不同关系类型的特征,揭示了探针准确性和关系特异性、实体连通性以及探针所依赖的信号在注意力头上的分布情况之间的清晰相关性。最后,我们展示了如何使用探针预测的 词元级 特征归因来更详细地揭示探针行为。