论文
拒答活在聊天模型人设的下游
Refusal Lives Downstream of Persona in Chat Models
摘要
指令微调聊天模型中拒答与人设特质的线性方向都已被识别——但两者作为分离机制被研究。我们表明它们相互作用:顺从人设门控拒答。在Qwen2.5-7B-Instruct与Llama-3.1-8B-Instruct中——我们抽取顺从模型人设方向与拒答方向——并对两者干预。顺从人设转向抑制拒答——在Llama中拒答率从97%降到2%。重新引入拒答方向在晚层部分恢复拒答——但在早层不能。在晚层窗口投影掉人设方向恢复拒答到基线;投影掉随机方向则不能。因此拒答在晚层表达阶段被门控——位于其计算处的下游。把拒答当作单一孤立方向会错过其对人设的依赖。
