论文
抽象表征几何支撑大语言模型的推理
Abstract representational geometry supports inference in large language models
摘要
人类智力的定义特征是经从稀疏观察推断潜在任务结构来适应变化环境的能力。神经科学研究表明该能力依赖海马体构建抽象表示——在神经状态空间中表达为低维、近似正交的流形。但大语言模型(LLM)的内部机制大体不透明——不清楚它们在执行可比推理任务时是形成可比的抽象表示——还是依赖任务特定的统计规律。此处我们把情境反转学习范式适配到文本设定——在行为与表征两个层面比较人类与LLM。我们报告:虽然LLM展现可泛化推理的频率低于人类——但当此类推理发生时——其内部状态展现类似海马体报道的抽象几何结构。值得注意的是——该表征几何并非均匀分布——而是按模型深度层级组织:低层显示刺激身份的早期、稳定编码——而高层形成富含与推理关联的抽象情境几何的海马体样功能带。此外——互补干预实验在机制上把几何与推理联系起来:任务序列语言建模诱导几何解耦——而高层的几何正则化增加可泛化推理的涌现。合起来——这些发现确立抽象表征几何为支撑大语言模型推理的机制原则。