论文

持久先验,保留目标:斯特鲁普式的词汇覆盖范式

Persistent Priors, Preserved Targets: A Stroop-Style Paradigm for Lexical Override

模型评测模型行为与机制分析

摘要

本地定义可以为熟悉的单词赋予临时含义,而其通常的关联在其他地方仍然有用。我们用匹配的斯特鲁普式范式来衡量这些关联的干扰。冲突提示将医生定义为森林,并将森林与熟悉的副医院进行比较。中性控件在定义和查询中用语义较弱的词取代了 doctor,同时保持森林和医院不变。所有 11 个模型级平均值均为正值。总体手段对于所有四个冲突系列和提示格式也是积极的。当不存在重新定义时,对熟悉的干扰项的更强偏好预示着对任意语义、多义/实体和领域定义重新映射的更多干扰,而反义词斜率为零。我们分别将中性控制激活补丁到五个 1B-2B 模型中的反义词提示中。将定义的单词、定义中的目标单词和后面的查询单词一起修补可以恢复冲突中丢失的几乎所有目标减去干扰余量([0.92,1.06]中的标准化恢复 R)。仅用另一个项目的捐赠者替换目标词激活会降低每个测试案例的恢复率。这些捐赠补丁还降低了干扰项 logits,而上下文目标的下降幅度比恢复边缘的同一项目补丁下的下降幅度要大得多。