论文

使用逻辑规则对知识编辑进行基准测试

Benchmarking Knowledge Editing using Logical Rules

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地部署在需要访问最新知识的现实应用程序中。然而,重新训练 LLM 的计算成本很高。因此,知识编辑技术对于维护当前信息和纠正预训练模型中的错误断言至关重要。目前知识编辑的基准主要侧重于回忆编辑过的事实,往往忽略了它们的逻辑后果。为了解决这个限制,我们引入了一个新的基准,旨在评估知识编辑方法如何处理单个事实编辑的逻辑后果。我们的基准测试从知识图中提取给定编辑的相关逻辑规则。然后,它根据这些规则生成多跳问题,以评估对逻辑结果的影响。我们的研究结果表明,虽然现有的知识编辑方法可以准确地将直接断言插入到 LLM 中,但它们经常无法注入蕴含的知识。具体来说,使用 ROME 和 FT 等流行方法进行的实验表明,直接编辑知识和蕴涵知识的评估之间存在高达 24% 的巨大性能差距。这凸显了知识编辑中对语义感知评估框架的迫切需求。