论文
大语言模型 在上下文学习期间重新组织表征几何
Large language models reorganize representational geometry during in-context learning
摘要
大语言模型 (LLM) 在适应新任务方面表现出非凡的灵活性,无需参数更新,这种能力被称为上下文学习 (ICL)。之前的工作试图通过研究支持 ICL 的电路、算法和表示来理解 ICL。然而,为什么有些 ICL 任务很容易解决,而另一些任务却很难解决,这一问题仍然没有得到解决。在本文中,我们询问 LLM 是否可以任意调整其表示来解决简单的线性分类任务。具体来说,我们构建了一系列二元分类任务,其中通过将 LLM 自己的表示投影到不同的轴上来定义标签。令人惊讶的是,尽管所有任务都可以通过构造线性分离,但它们的上下文可学习性在不同轴上系统地变化。我们发现成功的 ICL 伴随着内部表示的几何重组,从而增加了任务相关的可分离性。沿着定义任务的轴放大神经活动的因果干预不足以改善行为表现或诱导这种表征重组。我们还表明,LLM 行为最好通过类似原型的算法来描述,该算法对表示进行操作,这些表示本身在上下文中进行了重组以适应任务。总之,这些发现提供了 LLM 中 ICL 的几何解释,表明通过训练获得的表示限制了通过上下文学习可以利用的内容。