论文
科普知识传播LLM知识更新错误较多
Popular Knowledge Propagates More Errors in LLM Knowledge Updating
摘要
通过 微调 更新语言模型的知识对于保持其输出最新至关重要,但也可能导致事实遗忘和新的幻觉。先前的研究表明,长尾知识更难获取,并且新记忆的长尾事实在以后的 微调 中很难保留。我们研究一个补充问题:在模型正确编码的事实中,哪些最容易在其他更新期间受到附带损坏?为了在现实的事实分布下研究这个问题,我们通过链接共享头部或尾部实体的三元组来构建经过验证的维基百科事实的大规模图 FACTPROP,从而保留事实知识之间的联系。我们根据事实陈述微调模型,并在每次更新后衡量正确与错误的事实。我们的结果揭示了一种与先前关于获取和保留期间长尾漏洞的发现不同的模式:在模型已经正确回答的事实中,与高度连接的实体相关的事实更有可能被相邻更新破坏,并且对此类事实的更新会更广泛地传播错误。因此,结构流行度可以预测脆弱性和下游损害。受这一发现的启发,我们提出了基于流行度的锚定(PopAnchor),这是一种轻量级的排练策略,可以保留一小部分流行事实并减少遗忘。