论文

可引导概念表示何时为真?LLM神经科学类似性跨家族审计中的测量混淆

When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs

模型评测模型行为与机制分析

摘要

越来越多报告称大语言模型(LLM)表现出类人的神经与认知特征,包括概念细胞、心理数字线和认知地图。这些论断通常依赖施加于单一模型的线性探测和激活引导,但两种方法都对测量选择高度敏感。因此,报告的类似性可能反映的是模型本身、测量流程,或两者兼有。我们跨五个家族的17个模型(参数量0.6B至72B)审计了四种代表性的神经科学启发范式。主实验考察概念方向的因果可引导性。在使用原始激活单元及固定层和系数时,可引导性似乎随模型规模增大而增强,貌似一种涌现能力。然而,这一模式由未校准的流程产生,而非引导文献中已确立的论断。该趋势同时依赖原始单元、读出指标和工作点;校正其中任何一项即可使其消失。采用残差范数可比的干预和留出的工作点选择后,概念引导在所有规模上仍然显著,但在Qwen3系列中未表现出显著趋势,尽管置信区间并未排除中等程度的正斜率。其余结果则好坏参半。线性地理世界地图在所有受测检查点(至72B)中均可一致解码。数量级信息被强编码,但单个神经元呈钟形还是单调形取决于选择标准。语言特定结构可定位,但跨语言不对称的方向在不同归因方法下会反转。这些结果表明,AI神经科学的主要制约不是缺乏现象,而是缺乏可比较的测量和充分的控制。我们发布协议、刺激材料和代码。