论文
空间故事:概念信念空间中的情境学习轨迹
Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space
摘要
大语言模型 (LLM) 在上下文中更新它们的行为,这可以被视为贝叶斯推理的一种形式。然而,该推论所依据的潜在假设空间的结构仍不清楚。在这项工作中,我们提出 LLM 在低维几何空间(概念信念空间)上分配信念,并且上下文学习对应于通过该空间的轨迹,因为信念随着时间的推移而更新。使用故事理解作为动态信念更新的自然环境,我们结合行为和表征分析来研究这些轨迹。我们发现(1)信念更新被很好地描述为低维结构化流形上的轨迹; (2)这种结构在模型行为和内部表示中得到一致的反映,并且可以用简单的线性探针进行解码以预测行为; (3)对这些表征的干预会因果地引导信念轨迹,其效果可以从概念空间的几何形状中预测。总之,我们的结果提供了 LLM 中信念动态的几何解释,为结构化概念表示中的上下文学习的贝叶斯解释奠定了基础。