论文
大语言模型的脚本选择:后期承诺的证据
Script Choice in LLMs: Evidence for Late-Layer Commitment
摘要
在本文中,我们使用两种互补的可解释性方法:逻辑回归探测和logit透镜分析,研究脚本知识如何在大语言模型的各个层之间分布。我们的探测实验揭示了明显的不对称性:输入脚本和指示的输出脚本都在网络的最早层中进行编码,而相反,对实际输出脚本的承诺仅出现在最后层中,模型的中间表示在大多数层中默认为拉丁语。这个两阶段过程得到了 logit-lens 分析的证实,该分析表明脚本提交始终发生在大语言模型的最后一层。加上在较小模型中观察到的较弱的脚本跟踪性能,这些结果形成了将脚本承诺与模型深度联系起来的证据,对设计足够深的、包容性的多语言架构具有更广泛的影响。