论文
实体之前的关系:语言模型事实回忆中的延迟承诺
Relation Before Entity: Deferred Commitment in Language Model Factual Recall
摘要
我们询问关系类型信息(例如,大写字母)和实体特定信息(例如,法国到巴黎)是否在召回过程中相同深度的最终标记位置处变得因果活跃。使用跨四个仅解码器模型和八个提示族的四个互补因果诊断,我们发现了强大的时间不对称性:关系信息在实体信息之前成为生成控制。在阈值 0.4 处,关系开始先于实体开始 10-16 个测试层(网络深度的 31-44%),并且在阈值 0.2-0.5 的所有 16 个模型阈值组合中保持顺序。至关重要的是,实体信息在早期并不缺失:实体词元修补在早期层中的成功率为 90-100%。相反,实体对生成的承诺被推迟:实体信息在实体词元位置可用,但只有在路由到最终词元后才成为最终词元的生成控制。