关于范围分类和当前知识编辑基准:负面结果,以 INLAY 作为无梯度案例研究
On Scope Classification and Current Knowledge-Editing Benchmarks: A Negative Result, with INLAY as a Gradient-Free Case Study
摘要
SERAC 谱系中的每个基于内存的知识编辑器都取决于范围决策:给定查询,存储的编辑是否适用?我们报告说,当前的知识编辑基准根本无法衡量这一决定。使用 INLAY,我们构建的一个无梯度编辑器,用于获取准确的每个查询 真值(模型被冻结,在外部可寻址内存中进行实时编辑,并且应用编辑是在解码时沿着一个标记的非嵌入方向添加的偏差),我们对跨越三个数据集和三个输入条件的 1,689 个查询执行每个候选路由器操作。每次选择最佳操作的 Oracle 路由器都会将单行静态策略与所有九个按条件数据集的单元格中的小数点后四位联系起来:任何每次查询路由方法可达到的最大增益为 0.00 点。弃权是 1,689 次中唯一获胜的行动,零次。 The cause is structural: these are counterfactual benchmarks whose evaluation question asks for the post-edit answer, so answering from parametric knowledge is wrong by construction, and a benchmark without negatives cannot reward a classifier's ability to reject.这超出了我们的系统,扩展到用于评估基准的整个范围分类器系列。我们直接确认了该机制:我们自己构造缺失条件,通过从一半样本的索引中保留查询自己的编辑,将池净空从精确的+0.0000移动到+0.0420,并给予弃权它的第一场胜利。我们还报告了 INLAY 本身没有获胜的地方(WISE 在 Qwen2.5-7B CounterFact 上击败了它,检索增强生成击败了我们测试的所有方法,包括 INLAY,在严格匹配的 RippleEdits 上),并披露了在我们自己的路由机制自我审计期间发现的两个错误,这两个错误都没有改变已发布的标题数字。