大语言模型功能性崩溃期间的关系式干预:词汇-统计消融与结构×语域因子实验
Relational Intervention During Functional Collapse in Large Language Models: A Lexical-Statistical Ablation and a Structure x Register Factorial
摘要
我们检验在小型语言模型发生功能性崩溃期间施加的关系式干预,其崩溃后行为是否能与技术性反馈、与词汇匹配的乱序对照、以及与两个语用维度各自的单独作用区分开来。我们使用Qwen3.5-4B并故意配置一个损坏的bash工具,在匹配对设计(50个任务)下跨六种条件运行300个回合:无干预(A)、技术性/非人称(B)、关系式/第一人称(C)、乱序关系式(D)、技术性/第一人称(E)、关系式/非人称(F)。E与F同B和C构成2x2因子设计,将关系式结构(承认、宽恕、能动性恢复、无条件接纳)与发送者语域(第一人称 vs. 非人称)解耦。我们报告两个主要发现。首先是注意力-行为解离:注意力跟随词汇惊奇度排序(D > F > C > E > B,所有q_FDR < 10^{-10}),乱序消息吸引了最多注意力;但在行为上A ~ B ~ D < E ~ F << C。其次,因子设计定位了C的效应:单独的关系式结构(F)或单独的第一人称语域(E)都无法复现C的行为特征;两个维度的主效应各自显著,且结构×语域交互在坚持性上显著(p = 0.046)。第三个解离出现在情绪探针上:F在8个探针中的7个上与C一致,却只产生基线行为,表明单独的关系式结构会安装一种探针级状态,只有与第一人称语域配对时才会转化为行为。模型的处理过程可分解为三个可解离的阶段:注意力(按词汇惊奇度排序)、探针级状态(按结构排序)和行为(按两者的合取排序)。
