推理模型中隐藏指令的选择性披露:行为不对称和转向
Selective Disclosure of Hidden Directives in Reasoning Models: Behavioral Asymmetry and Steering
摘要
思想链(CoT)推理痕迹越来越多地被提出作为人工智能监督的机制:原则上,检查模型推理的监视器可以检测仅从输出中看不见的不当行为。这假设 CoT 会显示模型被指示做什么,而不管给出的指示如何。我们沿着两个轴测试这个假设。首先,我们介绍指令合规性差距 (ICG):当该指令是恶意的与良性的时,模型的 CoT 显式引用隐藏系统提示指令的概率差异。在来自 5 个系列的 100 个任务对和 8 个前沿推理模型中,我们在 Qwen3-14B (Wilcoxon $p=0.0001$, $+13.9$pp)、Qwen3-32B ($p=0.0011$, $+13.0$pp)、Qwen3-235B 中发现一致的不对称披露,泄漏恶意隐藏指令的概率高于良性隐藏指令。 ($p=0.035$, $+5.8$pp),MiniMax-M2.5 和 DeepSeek-R1 的结果类似。该检测器对两个独立的盲标记通道具有 100% 的精度,并且仅读取推理迹线的 LLM 监视器可再现所有 8 个模型中针对无指令控制的不对称性,识别检测器归类为干净的 82% 的恶意迹线中的特定指令。其次,通过对比激活加法在 MiniMax-M2.5 中提取的转向向量会因果性地诱导对裸提示的隐藏,并从本来会产生它的提示中抑制它,并在预先注册的设计下在 Qwen3-14B 中复制。良性和恶性衍生的隐藏向量高度相似(MiniMax-M2.5 中的余弦 $0.804$;Qwen3-14B 中的 $0.970$),这意味着在这些模型中,披露不对称性源自共享隐藏方向的差异激活,而不是单独的机制。