论文
线性探针检测任务格式,而不是语言模型隐藏状态中的推理模式
Linear Probes Detect Task Format, Not Reasoning Mode in Language Model Hidden States
摘要
大语言模型 (LLM) 隐藏状态的线性探测被广泛用于声称模型学习不同推理类型的不同表示。我们通过在跨越经典三分法的三个基准上探测 Qwen3-14B 来对此进行测试:LogiQA 2.0(演绎)、ARC-Challenge(归纳)和 $α$NLI(归纳)。在 40 层中的第 32 层,线性探针通过良好分离的几何形状实现 100\% 交叉验证精度(固有维度:20.6、28.5、33.6;凸包污染 $\leq$1.5\%)。然而,这种分离完全是由格式混淆驱动的。残差源身份、选项计数和响应长度会降低偶然性的准确性。跟踪锚点相似性表明任务之间的推理在很大程度上是共享的(42.5\% 一致 vs.\ 33.3\% 机会),并且随机控制的因果转向 ($n=20$) 显示几何和推理模式之间没有功能联系 ($p=0.286$)。因此,高探测精度反映了任务格式而不是计算结构,从而激发了机械可解释性中的常规格式解混淆。