论文

深刻的思想和浅薄的探索

Deep Minds and Shallow Probes

模型评测模型行为与机制分析

摘要

神经表征不是唯一的对象。即使两个系统实现相同的下游计算,它们的隐藏坐标也可能因重新参数化而不同。因此,旨在揭示表示中已经存在的结构的探针族应该在相关表示对称性下保持稳定,而不是绑定到特定的基础。我们证明,在标准非简并假设下,行为等价的 LLM 具有通过可逆仿射变换相关的隐藏表示。由此产生的对称原理选出了浅坐标稳定探针的独特层次结构,其中线性探针作为其 1 度成员。我们还表明,跨模型探针传输的自然对象是共享探针可见商(探针系列不可见的表示模方向),而不是完全隐藏状态。合成任务和现实世界任务的实验支持这两种预测,显示 2 度探针在哪些方面可以超越线性探针,以及基于商的传输如何实现跨模型系列的覆盖感知监视器可移植性。这些结果指向更广泛的神经探测几何表示理论,其中覆盖感知监视器传输作为具体的操作结果。