论文

覆盖差距:基于超网络的即时 LLM 适应中知识冲突失败的严重性说明

The Override Gap: A Magnitude Account of Knowledge Conflict Failure in Hypernetwork-Based Instant LLM Adaptation

模型训练模型编辑与遗忘

摘要

基于超网络的方法(例如 Doc-to-LoRA)在一次前向传递中将文档内部化为 LLM 的权重,但它们在冲突上系统性地失败:当文档与预训练知识相矛盾时,最深层事实的准确度会下降到 46.4%。我们表明失败是一个严重的问题,而不是一个代表性的问题。超网络已经针对正确的层,但其适配器余量在整个文档中大致恒定,而预训练余量随着训练频率而增长,因此深层冲突会因构造而丢失。该账户预测失败应该跟踪先验强度:根据基本模型对矛盾事实的对数概率对 194 个冲突进行排序,基线准确度从弱先验问题的 68% 下降到强先验问题的 16%,差距达 52 个百分点。治愈方法是振幅。选择性层提升会在其顶级规范层上扩展适配器,而冲突感知内部化仅在基本模型有信心时才会触发提升。两者都是无需训练;它们将 Gemma-2B 上的深度冲突准确率从 46.4% 提高到 71.0%,将 Mistral-7B 上的深度冲突准确率从 53.6% 提高到 72.5%,同时保留小说知识的召回率,并且尽管完全在参数空间中运行,但在中等冲突上比普通检索增强生成提高了 18 个百分点。我们发布了 KID-Bench,这是一个包含 489 个问题的基准测试,可区分新颖的回忆、跨知识组合和先前分级的冲突。