论文

正确的知识,错误的答案:描述开放权重语言模型中的参数时间冲突

Right Knowledge, Wrong Answer: Characterizing Parametric Temporal Conflict in Open-Weight Language Models

模型评测模型行为与机制分析

摘要

语言模型可以对过时的事实及其更新的替代物进行编码。我们引入参数时间冲突(PTC),其中较新的事实存在且可恢复,但默认的前向传播更喜欢过时的事实。我们发布了 8,746 个维基数据位置持有者转换的确定性验证基准,并评估了三个系列的四种开放权重语言模型。在 61-81% 的 PTC 案例中,日期前缀提示可以恢复较新的事实。激活修补会翻转 72-85% 情况下的预测,并将偏好定位到特定于模型的上层区域。残余流转向优于规范匹配的随机方向,表明特定于方向的表示。这些结果表明 PTC 反映了本地化的表征偏好,而不是知识缺失。恢复是根据预言机识别的冲突来衡量的,因为自动检测仍然不可靠。我们发布基准、代码和统计数据。