论文
智能体在野外的安全上下文切换:通过正交适应减轻子空间干扰
Safe Context Switching for Agents in the Wild: Mitigating Subspace Interference via Orthogonal Adaptation
摘要
大多数大语言模型在两个连续任务之间表现出基本的张力,例如逻辑推理和安全对齐。复杂的思维链 (CoT) 推导所需的高方差内部状态可能会在几何上干扰编码安全约束的潜在表示。我们将这种现象识别为顺序子空间干扰,表明多步数学和代码生成等逻辑任务上的标准微调可能会导致对齐基准受到 23.3% 的干扰惩罚,从而大大削弱了模型的安全先验。当前的适应方法无法充分捕获这种推理漂移,因为逻辑任务的梯度很少与安全目标正交。为了解决这个问题,我们提出了 AURA(自适应唯一残差分配),这是一种谱正则化框架,可强制推理和安全之间的谱独立性。通过显式估计对齐流形的零空间并限制对其正交补集的推理更新,AURA 使模型能够在不影响安全性的情况下改进逻辑推理。根据经验,AURA 恢复了 23.0% 的性能损失,同时保持安全状态大于 0.98 的余弦保真度,这表明推理和对齐可以通过几何正则化有效解耦。
