论文
编码但未解码:LLM 语法中三级差距的层本地化证据
Encoded but Not Decoded: Layer-Localized Evidence for a Three-Level Gap in LLM Syntax
摘要
语言模型可能会以两种不同的方式未能通过语法测试:不编码相关结构,或者对其进行编码但未能在输出中使用它。仅凭行为评估无法区分这些。我们提出了一个三级评估框架(行为部署、LM头读数和探针可恢复性),在相同的二元决策下对相同的项目进行测量。使用紧凑的三语(英语、中文、德语)控制依赖性基准,我们发现探针可恢复性超过或等于 LM 头读数,这反过来又超过或等于行为部署,跨越七个模型和所有三种语言。在所有 14 种(模型、任务)条件下,可恢复性盈余永远不会为负。这种脱节集中在主题控制上,最接近的名词启发式给出了错误的答案。最大的单一差距 (0.653) 出现在 Qwen3-0.6B 指令的问答中。 Qwen3-14B 指令的差距仍然存在。从百分比来看,指令调整比编码对部署的影响更大。我们排除了选项位置偏差、后期层擦除、输出格式化伪影和探针训练方差。该模式与有利于表面捷径的解码一致,并且行为探测差距衡量了该偏好的强度。激活修补显示间隙是层局部化的。在指令调整下,LM头解码层比探测解码层晚移动大约十层。这些发现表明,行为评估低估了模型编码的内容,而单独探索则夸大了模型部署的内容。