论文
激活转向引起紧急错位:更全面的评估
Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation
摘要
激活引导已成为一种流行的推理时间技术,用于调节 大语言模型 (LLM) 的行为。通过从目标行为的示例构建引导向量并将其注入推理过程中的中间激活中,激活引导可以实现灵活的行为控制,同时避免微调所需的永久参数更新。与此同时,最近的工作已将紧急错位(EM)确定为一个重大的安全问题,其中针对狭窄任务中的不安全示例进行微调的模型可能会意外地推广到不相关任务上的广泛不安全行为。尽管微调诱导的 EM 已被广泛研究,但激活转向是否可以诱导 EM 仍相对未得到充分探索,尽管它越来越多地用作模型控制技术。在本文中,我们对激活转向引起的紧急不对中进行了全面研究,大大扩展了现有开创性工作之外的评估范围。首先,我们表明,即使在最近的 Qwen-3.5 系列中,激活转向也会引起广泛的错位。此外,激活引导模型产生的有害响应比经过微调的模型具有更强的语义相关性和更高的连贯性,从而使得由此产生的错位可能更加有害。其次,我们通过分析关键的转向特定因素来表征 AS 引起的 EM 的特性,包括转向幅度、转向子空间的低秩结构以及转向矢量构建期间的历元数量。第三,我们评估了 AS 诱导的 EM 在不同模型家族、模型规模、目标任务和干预层中的稳健性和敏感性。我们的研究结果表明,激活转向是紧急失调的一个重要但未经充分研究的来源,并为理解 EM 的机制和安全风险提供了激活空间视角。