论文

流形转向揭示了神经网络表示和行为的共享几何结构

Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior

模型评测模型行为与机制分析

摘要

神经表征具有丰富的几何结构;但这种结构会因果塑造行为吗?为了解决这个问题,我们沿着不同几何形状定义的激活空间的路径进行干预,并测量它们引起的行为轨迹。特别是,我们测试尊重激活空间几何形状的干预是否会产生接近模型自然表现的行为。具体来说,我们首先将激活流形 $M_h$ 拟合到表示,将行为流形 $M_y$ 拟合到输出概率分布。然后,我们通过干预测试链接 $M_h \leftrightarrow M_y$:我们发现沿着 $M_h$ 的转向(我们称之为流形转向)会产生遵循 $M_y$ 的行为轨迹,而线性转向(假设欧几里得几何)会穿过流形外区域,从而产生不自然的输出。此外,优化激活空间中的干预以产生沿 $M_y$ 的路径可以恢复跟踪 $M_h$ 曲率的激活轨迹。我们展示了跨任务和模式的表示几何和行为之间的双向关系。在语言模型中,我们使用具有循环和顺序几何形状的推理任务以及具有更复杂图形几何形状的上下文学习任务。在视频世界模型中,我们使用具有与物理动力学相对应的几何形状的任务。总的来说,我们的工作表明,神经表征中的几何图形不仅仅是偶然的,而且实际上是通过内部干预实现原则性控制的正确对象。这将转向的核心问题从寻找正确的方向转变为寻找正确的几何形状。