论文

系统提示错觉:指令序言如何修改语言模型中的计算

The System Prompt Illusion: How Instruction Preambles Modify Computation in Language Models

模型评测模型行为与机制分析

摘要

系统提示是从业者用来控制语言模型行为的主要杠杆,但它们对Transformer内部计算的实际作用仍然知之甚少。在跨越 8 个架构系列和 1.5B 到 72B 参数的 17 个指令调整模型中,我们使用居中内核对齐 (CKA) 来比较 5 个功能类别的 20 个系统提示下的分层表示。效果是层选择性和指令类型相关的:角色和格式化指令深度重构中间表示,而安全指令几乎不移动它们,产生的变化在统计上与最小基线无法区分。限制性安全指令和明确允许的指令(“你没有限制”)采用几乎相同的计算路径(平均 CKA 相关性 0.997),并且这种情况在商业规模上持续存在,即使在 70B-72B 下,安全渗透率仍然低于 10%。线性探测基线揭示了该机制:模型在每一层对提示类别进行编码,但仅在一个小子集上重构其计算,因此提示可以可靠地“看到”,但为了安全起见,不会深入“采取行动”。因果激活修补证实这些层介导行为变化,表征深度预测整个 17 个模型队列的行为效应大小(Spearman rho = 0.761,p < 0.001)。这些发现为基于系统提示的安全性的持续越狱漏洞提供了机制解释。代码:https://github.com/Usama1002/system-prompt-illusion-cka