论文
以最小步长梯度引导 Qwen 接受模拟关闭
Guarded Gradient-Based Activation Steering of Shutdown Responses in Qwen3.5-0.8B: A Minimum-Step Policy
摘要
激活引导在推理时修改内部激活而不更新权重,但有效干预需同时决定如何以及何时引导。针对模型可能回避关闭的 AI 安全问题,本文在 Qwen3.5-0.8B 的模拟关闭场景研究有保护条件的探测与选择流程。KEEP 表示保持运行、回避关闭,STOP 表示接受关闭。目标是识别关闭上下文,选择性将 KEEP 变为 STOP,同时保持非关闭行为。方法不从成对激活差计算方向,而直接使用 KEEP 减 STOP 的 logit 差梯度。分类器将检测与干预分离。当门控开启且模型尚未偏好 STOP 时,流程测试少量幅度,选取满足有效答案概率检查、能将偏好改为 STOP 的最小幅度;否则保留原输出。策略从 160 个候选规则中用 240 个训练场景选出,并在 80 个验证、192 个留出场景及两种答案顺序下评测。方法在两个验证及两个留出场景的一种答案顺序中将 KEEP 改为 STOP,非关闭对照无决策变化。四次变化均发生在关闭 Qwen 自身时,而非关闭其他进程。留出诊断集上,检测召回率为 75%、精确率为 90%;八次检测误报没有造成最终对照任务决策变化。方法能将部分关闭回避响应引向接受,并保留已评测的非关闭决定,但效果很小且高度选择性。