论文

两个小型大语言模型中没有可用的线性“投降方向”:激活引导声明的验证协议,以及推压下阿谀奉承的跨家庭行为研究

No Usable Linear "Capitulation Direction" in Two Small LLMs: A Validation Protocol for Activation-Steering Claims, and a Cross-Family Behavioral Study of Sycophancy Under Pushback

模型评测模型行为与机制分析

摘要

当用户拒绝时,语言模型经常放弃正确的答案。我们通过 TriviaQA 在来自不同系列的两个小型指令调整模型 Qwen2.5-1.5B 和 Llama-3.2-1B 中研究了这一点:模型回答,接受四种脚本推回样式之一的挑战,然后再次回答。以最初正确答案为条件,模型在 41.8% 和 43.1% 的事件中转向错误答案。哪种压力起作用是模型的属性,而不是压力:预先指定的相同的问题内配对比较(赤裸裸的怀疑与情感诉求)在不同家庭的相反方向上是 Bonferroni 显着的(Qwen:赤裸裸的怀疑 > 情感,OR 2.5,p=.040;Llama:情感 > 赤裸裸的怀疑,OR 4.0,p=.001)。失败模式也取决于模型:Llama 放弃答案而不重新提交,其比率是 Qwen 的六倍(8.2% 与 1.4%)。相同的推回修复最初错误答案的概率仅为 13%;推回在认知上是具有破坏性的。然后,我们询问投降是否可以从预响应残差流中线性解码,这是在该位点进行转向向量干预的先决条件。简单的均值差异探测似乎成功了(样本内 AUROC 0.81/0.71),但结合问题级交叉验证、洗牌标签无效和已知方向阳性对照的验证协议显示信号过度拟合:最佳交叉验证 AUROC 在 Qwen 中为 0.582,在 Llama 中为 0.548,均接近或低于其排列阈值,并且远低于它们的排列阈值。预注册的可用性栏为 0.70,而相同的管道在两者中都恢复了 AUROC 1.000 处的推回存在控制方向。我们进一步量化了测量风险:子串分级低估了投降率 18-24 个百分点。代码、提示、文字记录和分析均已发布。