论文
语义引力井:为什么负向约束适得其反
Semantic Gravity Wells: Why Negative Constraints Backfire
摘要
负向约束(“不要使用词X”形式的指令)是对大语言模型指令遵循能力的一项基本考验。尽管看似简单,这些约束却以惊人的规律性失败,而支配失败的条件一直知之甚少。本文首次对负向指令失败开展全面的机制性研究。我们引入语义压力(semantic pressure),衡量模型生成被禁token的内在概率,并证明违规概率与压力之间遵循紧密的logistic关系(p=σ(-2.40+2.27·P_0);n=40,000样本;斜率的bootstrap 95%置信区间:[2.21, 2.33])。通过logit lens技术的逐层分析,我们确立:负向指令诱发的抑制信号在失败情形中虽存在但系统性更弱——失败时指令仅将目标概率降低5.2个百分点,而成功时降低22.8个百分点,呈现4.4倍的不对称。我们将这种不对称追溯为两种机制不同的失败模式。在启动失败(priming failure,占违规的87.5%)中,指令对被禁词的显式提及悖论性地激活而非抑制目标表示。在覆盖失败(override failure,占12.5%)中,后层前馈网络向目标概率贡献+0.39——约为成功情形的4倍——压过早期抑制信号。激活修补(activation patching)确认第23至27层负有因果责任:替换这些层的激活会翻转约束效应的符号。这些发现揭示负向约束设计的根本张力:命名被禁词这一行为本身就在启动模型去生成它。