论文

“AlphaEdit:语言模型的零空间约束知识编辑”的再现性研究

Reproducibility Study of "AlphaEdit: Null-Space Constrained Knowledge Editing for Language Models"

模型评测模型能力评测

摘要

方等人。 (2025) 引入了一种名为 AlphaEdit 的零空间约束投影,用于定位然后编辑知识编辑方法,从理论上保证编辑不会破坏先前保存的知识,并报告了 LLaMA3、GPT2-XL 和 GPT-J 上现有编辑方法的实质性改进。在这项工作中,我们提出了 AlphaEdit 的可重复性研究,在原始实验设置下重现了其报告的结果,并沿着三个轴扩展了评估:新的模型架构、额外的下游基准和更长的顺序编辑范围。尽管我们发现报告的流畅性和一致性指标存在差异,但我们成功地在原始模型中重现了 AlphaEdit 报告的指标。将 AlphaEdit 扩展到较新的模型系列,我们发现它的优势并不能统一推广,我们可以追溯到定位然后编辑范式中的架构假设,而这些新模型违反了这些假设。我们通过将编辑数量远远超出原始论文中评估的数量,进一步对 AlphaEdit 的核心顺序编辑主张进行压力测试,并发现,在最初报告的规模下稳定的性能,随着编辑数量达到更高的数量而下降,这表明零空间投影对灾难性遗忘的保护是有界的,而不是无条件的。最后,我们在三个额外的基准(即 BoolQ、HellaSwag 和 XSTest)上扩展了对编辑模型的评估,我们发现大规模顺序编辑会降低一般下游任务能力和与安全相关的拒绝行为。我们的结果证实了 AlphaEdit 在其原始范围内的表现,同时表明其核心理论保证对模型架构和编辑规模敏感,对其部署具有实际影响。