论文
我们是否在正确评估LLM模型编辑的编辑局部性?
Are We Evaluating the Edit Locality of LLM Model Editing Properly?
摘要
模型编辑近来已成为高效更新LLM知识的热门范式。更新知识的一个核心目标是平衡编辑效能(即目标知识的成功注入)与特异性(亦称编辑局部性,即保留既有非目标知识)。然而,我们发现现有的特异性评估协议并不足以实现这一目的。我们系统阐述了它面临的三个根本问题。在概念问题之外,我们进一步以实证表明,现有特异性指标与特异性正则化器的强度之间仅存在弱相关。我们还发现,当前指标缺乏足够的灵敏度,无法有效区分不同方法的特异性表现。最后,我们提出一个构造性评估协议。在该协议下,开放式LLM与确定性答案假设之间的冲突被消除,与查询无关的流畅度偏差得以避免,且评估严格度可在近连续空间内平滑调节。跨多种LLM、数据集和编辑方法的实验表明,由所提协议导出的指标对特异性正则化器强度的变化更为敏感,并与之呈强相关,能够更细粒度地区分不同方法的知识保留能力。
