论文

智能体在野外的安全上下文切换:通过正交适应减轻子空间干扰

Safe Context Switching for Agents in the Wild: Mitigating Subspace Interference via Orthogonal Adaptation

模型训练参数高效训练

摘要

大多数大语言模型在两个连续任务之间表现出基本的张力,例如逻辑推理和安全对齐。复杂的思维链 (CoT) 推导所需的高方差内部状态可能会在几何上干扰编码安全约束的潜在表示。我们将这种现象识别为顺序子空间干扰,表明多步数学和代码生成等逻辑任务上的标准微调可能会导致对齐基准受到 23.3% 的干扰惩罚,从而大大削弱了模型的安全先验。当前的适应方法无法充分捕获这种推理漂移,因为逻辑任务的梯度很少与安全目标正交。为了解决这个问题,我们提出了 AURA(自适应唯一残差分配),这是一种谱正则化框架,可强制推理和安全之间的谱独立性。通过显式估计对齐流形的零空间并限制对其正交补集的推理更新,AURA 使模型能够在不影响安全性的情况下改进逻辑推理。根据经验,AURA 恢复了 23.0% 的性能损失,同时保持安全状态大于 0.98 的余弦保真度,这表明推理和对齐可以通过几何正则化有效解耦。

智能体在野外的安全上下文切换:通过正交适应减轻子空间干扰的原论文方法或结果图
图 2:AURA 方法概述。该图说明了顺序训练管道。左(朴素):标准 PEFT 导致“频谱崩溃”,其中活动适配器 ($B_{2}A_{2}$) 写入与冻结的先前适配器 ($B_{1}A_{1}$) 相同的子空间,导致共享 KV 缓存被冲突功能污染。右(AURA):我们强制执行几何约束($\mathcal{L}_{AURA}$),将活动子空间 $\mathcal{S}_{2}$ 推入先前子空间 $\mathcal{S}_{1}$ 的正交补集。这将共享剩余流显式划分为不相交的带,确保任务 1 的“记忆足迹”对于任务 2 的读取头不可见。