论文

当模型不操纵流形时:比较任务的几何结构

When Models Don't Manipulate Manifolds: The Geometry of a Comparison Task

模型评测模型行为与机制分析

摘要

当前机制可解释性研究的前提之一是,对神经网络表示几何的详细描述可以告诉我们模型如何执行计算,以及如何有效地干预它们。虽然在文献中已经观察到低维流形的多个概念(例如,螺旋上编码的数字、圆上的一周中的日子……),其结构被认为反映了数据和任务的属性,但模型依赖它们进行计算的程度以及它们如何操纵它们仍然不清楚。我们精确地描述了数字比较任务中计算的几何形状,作为决策比较的抽象,以及模型如何以优雅的方式利用几何形状来实现它。具体来说,我们研究了 Qwen2.5-7B-Instruct(一种功能强大且广泛研究的开放权重模型)中数字比较的因果几何,并发现尽管存在弯曲几何,但 Qwen 很大程度上使用数字的线性表示。为了比较两个数字,模型首先沿着向量对每个数字进行编码,并使用注意力和残差连接将两个表示相加,将它们带入残差流中的共享空间。然后,该模型使用 MLP 神经元来比较该共享空间中局部区域上的数字对,这些数字对应于输入数字的较小间隔,并将它们组合起来以获得最大值的位置。事实上,当模型比较三个数字时,这种对线性表示进行比较的依赖仍然存在。我们的研究结果表明,流形假设可以与线性表示共存:虽然有序的概念在表示中可能具有流形结构,但模型可以在某些计算中使用概念的基础线性结构。