论文
大型语言模型在上下文中开发信念状态几何
Large Language Models Develop Belief State Geometry In-Context
摘要
经过下一个标记预测训练的大型语言模型 (LLM) 表现出出色的上下文学习 (ICL) 能力,但支持 ICL 的表示形式仍然知之甚少。我们在受控环境中考虑此类表示:用隐马尔可夫模型 (HMM) 发出的数据提示 LLM,并探测相应的信念状态——给定观察到的标记历史的 HMM 隐藏状态的后验分布。在六个开源 LLM 中,使用来自为非平凡信念结构选择的 40 个 HMM 的数据进行提示,我们发现信念状态可以从残余流激活中线性解码,在 HMM 和 LLM 组合中,从早期层到晚期层,峰值探测 $R^2$ 值从 0.83-0.99 不等。为了建立功能相关性,我们通过修补和转向直接干预探针识别的子空间,从而导致下游预测质量达到未篡改模型的数量级,而控制则大大降低了性能。总之,这些结果提供了表征级证据,表明开源大语言模型中的 ICL 近似于上下文推断生成模型的最佳贝叶斯预测。更广泛地说,我们的研究结果扩展了将输入分布结构与激活几何联系起来的先前结果:从在 HMM 数据上显式训练的玩具网络到生产规模的大语言模型。